Select Page
Ideogram 4 實作教學:在 ComfyUI 本機部署最強開源 AI 繪圖模型

Ideogram 4 實作教學:在 ComfyUI 本機部署最強開源 AI 繪圖模型

2026 年最受矚目的 AI 繪圖模型之一,莫過於 Ideogram 團隊正式釋出的:

Ideogram 4

這是 Ideogram 首次公開模型權重(Open Weight),也是目前開源陣營中,在:

  • 文字生成(Text Rendering)
  • 海報設計
  • 品牌廣告
  • 排版控制
  • JSON 結構化提示詞

官方資料顯示,Ideogram 4 採用 9.3B 參數的單流 Diffusion Transformer(DiT)架構,並支援原生 2K 圖像生成。

本篇將帶你使用 ComfyUI,在本機部署 Ideogram 4。


系統需求

官方模型共有兩個版本:

版本量化
Ideogram 4 FP8品質最佳
Ideogram 4 NF4VRAM需求較低

目前 ComfyUI 官方整合版本主要使用:

  • FP8
  • NVFP4

其中 FP8 畫質最佳。


第一步:下載模型

ComfyUI 專用模型

官方:

Comfy-Org Ideogram-4

原始模型:

Ideogram 4 FP8 官方模型


第二步:放置模型檔案

依照官方說明建立目錄。

ComfyUI
│
├─ models
│  ├─ diffusion_models
│  │  ├─ ideogram4_fp8_scaled.safetensors
│  │  └─ ideogram4_unconditional_fp8_scaled.safetensors
│  │
│  ├─ text_encoders
│  │  └─ qwen3vl_8b_fp8_scaled.safetensors
│  │
│  └─ vae
│      └─ flux2-vae.safetensors

第三步:了解每個模型用途

ideogram4_fp8_scaled

主模型

負責:

  • 圖片生成
  • 構圖
  • 風格
  • 排版

ideogram4_unconditional_fp8_scaled

CFG 引導模型

負責:

  • 提升細節
  • 強化 Prompt Follow
  • 改善品質

官方建議兩個模型一起使用。若只載入主模型雖可運作,但畫質會下降。


qwen3vl_8b_fp8_scaled

文字編碼器

負責:

  • Prompt 理解
  • JSON 理解
  • 空間推理
  • 海報版面配置

flux2-vae

VAE 解碼器

負責將 Latent 轉換成圖片。


第四步:更新 ComfyUI

Ideogram 4 需要最新版本的 ComfyUI。

更新方式:

cd ComfyUI

git pull

或:

update_comfyui.bat

官方於 Day-0 即已原生支援 Ideogram 4。


第五步:載入官方 Workflow

ComfyUI 官方已提供範例工作流。

建議直接從:

Comfy Blog

下載 Workflow


基礎工作流架構

Prompt
    ↓

Qwen3-VL Encoder
    ↓

Ideogram 4
    ↓

Sampler
    ↓

Flux VAE Decode
    ↓

Save Image

第六步:第一張圖片

測試 Prompt:

A futuristic cyberpunk city at night,
neon signs in Chinese,
cinematic lighting,
ultra detailed,
high contrast,
8k photography

生成尺寸:

1024 x 1024

推理模式:

DEFAULT

第七步:體驗 JSON Prompt

Ideogram 4 最大特色就是:

Structured JSON Prompt

官方模型訓練時即使用 JSON Caption。


範例:海報設計

{
  "scene_summary": "Professional technology conference poster",

  "background": {
    "description": "Modern convention center stage with blue ambient lighting, large LED screen, clean professional environment"
  },

  "style": {
    "description": "Corporate marketing design, professional conference poster, clean typography, premium branding, modern layout"
  },

  "objects": [
    {
      "description": "Conference stage",
      "bbox": [100, 150, 900, 850],
      "colors": ["#0A2540", "#1E88E5", "#FFFFFF"]
    }
  ],

  "text_elements": [
    {
      "text": "AI SUMMIT 2026",
      "bbox": [150, 120, 850, 260],
      "style": "Large bold white sans-serif title"
    },
    {
      "text": "Future of Artificial Intelligence",
      "bbox": [180, 280, 820, 350],
      "style": "Medium white subtitle"
    },
    {
      "text": "Taipei International Conference Center",
      "bbox": [180, 1050, 820, 1120],
      "style": "Small white footer text"
    }
  ]
}

Bounding Box 控制

可直接指定位置。

{
  "text_elements":[
    {
      "text":"SALE 50%",
      "bbox":[100,100,500,300]
    }
  ]
}

座標範圍:

0 ~ 1000

原點:

左上角

這是目前 FLUX 與 Stable Diffusion 所不具備的能力。


色彩盤控制

品牌設計超級好用。

{
  "color_palette":[
    "#FF6600",
    "#FFFFFF",
    "#000000"
  ]
}

官方支援:

  • 最多16色
  • 單元素最多5色

與 FLUX 比較

FLUX 強項

  • 寫實攝影
  • 光影細節
  • 人像品質

Ideogram 4 強項

  • Logo
  • 海報
  • Banner
  • 電商素材
  • 排版設計
  • 中文文字生成

若你是:

  • 電商設計師
  • 行銷公司
  • 品牌設計
  • 廣告公司

Ideogram 4 很可能比 FLUX 更適合。


結論

Ideogram 4 不只是另一個 AI 繪圖模型。

它最大的創新在於:

把 Prompt 從自然語言升級為結構化設計規格。

透過:

  • Qwen3-VL
  • Diffusion Transformer
  • JSON Prompt
  • Bounding Box
  • Color Palette

使用者終於可以像操作 Figma 一樣控制 AI 生成內容。

對於需要:

  • 海報設計
  • 品牌素材
  • Banner 製作
  • AI Agent 自動產圖

的開發者來說,Ideogram 4 是目前最值得研究與部署的開源模型之一。

Ideogram 4.0 技術解析:9.3B 參數 DiT 架構、結構化 JSON 提示詞與 2K 原生輸出,Diffusion Transformer 革命登場

Ideogram 4.0 技術解析:9.3B 參數 DiT 架構、結構化 JSON 提示詞與 2K 原生輸出,Diffusion Transformer 革命登場

AI 圖像生成正式進入「設計級控制」時代

近兩年 AI 繪圖領域競爭激烈,從 Midjourney、Stable Diffusion、FLUX,到 Google Imagen,各家模型都在追求更好的畫質與更精準的提示詞理解能力。

真正困擾設計師與企業用戶的問題其實不是畫質,而是以下的問題:

  • 文字總是生成錯誤
  • 排版無法控制
  • Logo 與標題位置不準確
  • 無法符合品牌色彩規範
  • 每次生成結果都像在「抽卡」

2026 年 6 月,Ideogram 正式推出最新開源模型:

Ideogram 4.0

這不僅是 Ideogram 首次公開權重(Open Weight)模型,更被許多開發者視為目前最接近商業設計工作流程的 AI 圖像生成系統。


什麼是 Ideogram 4.0?

Ideogram 4.0 是一款從零開始訓練的 AI 圖像生成模型,採用最新的:

Diffusion Transformer(DiT)架構

與傳統 Stable Diffusion 不同,Ideogram 4.0 使用:

  • 34 層 Transformer
  • 93 億參數(9.3B)
  • 單流(Single Stream)設計
  • 文字 Token 與影像 Token 共用同一套注意力機制

官方稱其為:

Single-Stream Diffusion Transformer(DiT)

這種架構讓模型能更深入理解文字與影像之間的關聯,提高提示詞遵循能力(Prompt Adherence)與版面控制能力。


核心架構解析

1. 文字編碼器(Text Encoder)

Ideogram 4.0 並未使用傳統的 CLIP 或 T5 「文字編碼器(Text Encoder)」。

而是採用了:

Qwen3-VL-8B-Instruct

作為文字理解引擎。

其特色包括:

  • 視覺語言模型(Vision Language Model)
  • 僅使用文字模式
  • 提取 13 個中間層隱藏狀態
  • 將多層特徵串接後輸入 DiT

這種設計能同時保留:

  • Token 級語意
  • 物件關係
  • 空間推理
  • 構圖理解

讓模型對複雜提示詞有更深層的理解能力。


2. DiT 主幹網路

Ideogram 4.0 採用:

  • 34 Layers
  • Embedding Dimension:4608
  • 18 Attention Heads
  • SwiGLU Feed Forward

總參數量達:

9.3 Billion Parameters

目前已是開源 AI 繪圖模型中最頂尖的規模之一。


3. VAE 解碼器

使用凍結(Frozen)的:

KL VAE

特性:

  • 8× 空間壓縮
  • 128 Latent Channels

負責將潛在空間(Latent Space)轉換為最終圖像。


4. Flow Matching 取樣器

不同於傳統 DDPM。

Ideogram 4.0 採用:

Euler Flow Matching

搭配:

Asymmetric CFG

特色:

  • 提升生成效率
  • 改善細節品質
  • 更穩定的提示詞遵循能力

官方提供三種推理模式:

模式Steps
V4_TURBO12
V4_DEFAULT20
V4_QUALITY48

品質模式會在最後階段降低引導強度,進一步提升真實感。


最大突破:JSON 結構化提示詞

這是 Ideogram 4.0 最具革命性的地方。

過去 AI 繪圖都依賴自然語言:

A beautiful girl standing beside a lake...

Ideogram 4.0 則改為:

{  "background": "...",  "objects": [...],  "texts": [...],  "style": {...}}

模型訓練時完全使用 JSON 描述,因此天生理解結構化資訊。


Bounding Box 精準版面控制

支援 Bounding Box:

{  "bbox": [100,100,400,400]}

採用:

  • 0~1000 正規化座標
  • 左上角為原點

可直接指定:

  • Logo 位置
  • 標題位置
  • 商品位置
  • 人物位置

這是過去 Midjourney、Stable Diffusion 很難做到的功能。


色彩盤控制(Color Palette)

可直接指定品牌色:

{  "colour_palette": [    "#FF6600",    "#FFFFFF",    "#000000"  ]}

限制:

  • 每張圖最多 16 色
  • 每個元素最多 5 色

非常適合:

  • 品牌設計
  • 電商素材
  • 廣告 Banner
  • 包裝設計

多語言文字生成能力大幅提升

Ideogram 一直以來最強的能力就是:

Text Rendering

也就是圖片內文字生成。

例如:

  • 海報
  • Logo
  • 廣告標語
  • 包裝文字
  • 社群貼文

以往 AI 經常出現亂碼。

但 Ideogram 4.0 已能大幅提升:

  • 中文
  • 英文
  • 日文
  • 韓文

等多語系文字品質。


原生支援 2K 輸出

解析度支援:

  • 最小:256 × 256
  • 最大:2048 × 2048

且:

  • 必須為 16 的倍數
  • 最長比例可達 6:1

例如:

  • YouTube Banner
  • 網站橫幅
  • 電商主圖
  • 手機桌布

皆可直接生成。


設計工作流功能全面升級

除了模型本身之外,Ideogram 平台也同步推出多項設計工具:

Prompt Edit

直接修改既有圖片中的特定區域。

Magic Fill

局部重繪。

Remix

基於現有圖片重新生成。

Extend / Reframe

擴展畫布與調整比例。

Upscale

提高解析度。

Transparent Background

直接輸出透明背景 PNG。

MCP 整合

可接入 AI Agent 工作流程。

Editable Text Layers

未來將支援真正可編輯的文字圖層功能。


Ideogram 4.0 與 Google Imagen 誰更強?

若比較:

  • Google Imagen
  • FLUX
  • Stable Diffusion
  • Ideogram 4.0

目前 Ideogram 最大優勢在於:

✅ 文字生成能力

✅ 排版控制能力

✅ JSON 結構化設計流程

✅ 開源權重

✅ 可自行部署

而 Google Imagen 仍在:

  • 寫實度
  • 影像理解
  • Google 生態整合

方面維持優勢。

若是企業設計工作流,Ideogram 4.0 已經是極具競爭力的選擇。


官方資源

官方網站

Ideogram 官方網站

模型介紹

Ideogram 4.0 Model Page

技術部落格

Ideogram 4.0 Technical Details

API 文件

Ideogram Developer API

GitHub

Ideogram 4 GitHub Repository

Hugging Face

Ideogram 4 Hugging Face Collection


Ideogram 4.0 不只是另一個 AI 繪圖模型。

它最大的突破在於:

把 AI 繪圖從「描述圖片」提升到「設計圖片」。

透過:

  • Diffusion Transformer(DiT)
  • Qwen3-VL 編碼器
  • JSON Prompt
  • Bounding Box 控制
  • 色彩盤控制
  • 可編輯文字圖層

Ideogram 4.0 正逐步接近 Photoshop、Illustrator 與 Figma 所代表的專業設計工作流程。

對於品牌設計、電商素材、廣告製作與 AI Agent 自動化內容生成來說,Ideogram 4.0 很可能會成為 2026 年最值得關注的開源 AI 圖像生成模型之一

AIX Studio:支援光影特效與 API 整合的高質感 AI 繪圖平台

AIX Studio:支援光影特效與 API 整合的高質感 AI 繪圖平台

什麼是 AIX Studio?

AIX Studio 提供了一系列 AI 繪圖與視覺特效功能,讓使用者從文字提示、圖片輸入,甚至批量處理模式,快速生成具質感、具光影效果的視覺作品,並結合類似服務模式,它不僅針對創作者介面,也支援 API 整合,適合企業/開發者接入。

此外,從應用場景來看:

  • 支援「電商場景圖片」:例如產品在光影下的立體感、背景反射、陰影鮮明。
  • 室內設計視覺:場景光源處理、物件材質質感、自然光或人造光的投射。
  • 人像後期與自媒體內容:人臉光影、高光處理、背景模糊與光線設計。
  • API 整合:可將生成流程嵌入自家 APP、網站或後台服務,自動產出多版本視覺素材。

多種光影特效與後期應用

這裡列出 AIX Studio 在光影與後期特效方面值得關注的功能:

  • 光源模擬:例如自然光、側光、背光、點光源等,讓畫面具備立體感與深度。
  • 陰影與反射處理:物體在場景中的陰影投射、反光面板、水面反射或鏡面效果。
  • 材質質感增強:金屬、玻璃、布料、木材等不同材質在光影下的變化。
  • 後期風格化特效:如「電影膠片風格」、「電商清晰專業風」、「室內柔光」等。
  • 批量生成與版本控制:可設定不同光影/風格參數,一鍵生成多版本,方便 A/B 測試或素材庫建立。
  • API 調用:對於開發者而言,可透過 API 傳送文字提示、圖片資料、光影參數,回收到生成圖像,便於整合至 APP/網站。

為什麼選擇 AIX Studio?

  • 多場景適用:從電商商品照、室內設計視覺、到人像後期、自媒體封面,一應俱全。
  • 光影特效為核心亮點:不少 AI 繪圖工具偏重「風格化」或「插畫感」,但 AIX Studio 將光影處理、材質質感視為重點。
  • 開發者友善 API:如果你已有 APP 或網站需要圖片生產流程自動化或大量生成,API 支援是重要優勢。
  • 節省製作成本與時間:過去可能需要專業攝影或後製師處理光線與材質,現在藉助 AI,可快速生成可用素材。

快速上手指南:三步驟生成質感圖像

步驟 1:明確構思場景與用途
例如:電商商品照想營造「高質感玻璃反射+柔光背光」,室內設計視覺想呈現「黃金時刻自然光+木質家具陰影」。
步驟 2:在 AIX Studio 輸入提示/上傳圖片+調整光影參數

  • 可選文字提示:如「luxury product on glass table, strong side light, velvet fabric backdrop, high contrast shadow」。
  • 若已有素材,可上傳圖片並選擇「材質+光源模擬」參數。
  • 點選生成後,系統處理後回傳圖像。

步驟 3:後製/整合與輸出
若需要品牌貼紙、文字疊加、社群尺寸調整,可將生成圖像匯入 Photoshop、Illustrator 或 Canva 進行微調,最後輸出適用於電商頁、社群貼文、封面圖。


注意事項與實用 Tips

  • 提示越具體,光影效果越精準:描述中加入「光源類型、陰影強度、反射面材質、色溫」等詞彙。
  • 材質設定影響大:例如「玻璃反射」與「布料柔光」處理方式不同,提示中應明確指出。
  • 確認 API 授權與用途:若將生成圖像用於商用或整合至 APP 中,需確認 API 條款與版權可否。
  • 儲存提示與參數記錄:若你生成多版本圖像,建議記錄提示詞、模型版本、光影參數,以便後續重現或修改。
  • 後製仍能提升質感:雖然 AI 生成已具備光影特效,但你仍可手動微調色彩、加文字、疊圖效果以符合品牌風格。

參考資料

https://draw.aix.studio

「從零開始:如何用 ChatArt 免費生成小說與插圖」

「從零開始:如何用 ChatArt 免費生成小說與插圖」

ChatArt 是一款整合 AI 聊天、寫作、繪圖的工具平台。它支援用戶用對話方式輸入想法、選擇創作場景,平台便會協助產出文章、小說,甚至圖片。根據官網介紹,它提供小說產生器、圖生圖、文生圖功能,並且多平台支援(網頁/手機/平板)

為什麼用 AI 來寫小說、畫圖?

  1. 激發創意、打破瓶頸
    許多人在寫作或畫圖時會卡關:構思難、敘事斷裂、視覺想像模糊。透過 AI ,您可以輸入關鍵字:「奇幻世界、機器人女孩、秋天森林」… AI 即刻幫您延展敘事、生成畫面。這種「腦力解放」讓創作更順暢。
  2. 節省時間、提高效率
    傳統手寫小說或手繪畫圖,從無到有需花很多時間構思、草稿、修正。利用 AI 工具,許多初稿可迅速生成,您再進行潤飾即可,大幅縮短創作週期。
  3. 視覺與文字一體化
    在 ChatArt 中,您不只寫小說,也能同步產出畫圖(如「文生圖」)。這意味著:「我寫一段場景 → AI 畫一幅配圖」成為可能,增強作品整體感。
  4. 免費/低成本起步
    雖然有付費方案,但 ChatArt 提供免費試用或低門檻方案,適合創作者先探索、建立習慣,再決定是否升級。這對想先試水溫的用戶友善。

如何用 ChatArt 來寫小說+畫圖 — 步驟指南

以下為建議流程,協助您快速上手:

1. 明確構思主題
先決定小說主題/畫圖場景。例:「未來城市中的漂浮圖書館」、「中世紀魔法少女與龍的故事」。這能作為 AI 輸入提示。

2. 開啟小說產生器
在 ChatArt 選擇「小說產生器」或「寫作助手」,輸入您的主題、角色、設定(例如:主角、世界觀、衝突)。平台便會生成一段文字。您可以修改、擴充或重新生成。

3. 產出畫圖
將小說中的一幕(例如:主角站在漂浮圖書館的陽臺)輸入「文生圖」功能,讓 AI 依您描述生成對應畫面。此外,也可使用「圖生圖」將已有圖片轉為不同風格。這樣小說與畫圖同步,視覺+文字雙軌。

4. 潤飾與整合
由 AI 產出的內容通常為草稿級,可依您的風格調整文字、修正畫面細節。此階段可加入對話、細節描寫、畫圖色調風格等。

5. 發佈與迭代
完成後,您可在部落格或社群上發佈,若讀者反饋良好,還可將這個作品延伸成系列。每次都可回到 ChatArt 進行新章節/新畫面創作。


創意應用案例

  • 短篇小說+插圖集:用 ChatArt 快速創作一篇短篇(如 1000 字內)+ 3~5 張配圖,製作成自己的電子書。
  • 社群圖文貼文:每日/每週用 AI 畫圖+配一段創意文字,在 Instagram 、 X 或 Facebook 刊出,快速累積風格與粉絲。
  • 故事連載+視覺系列:將創作拆成「章節」+「每章畫圖」,展開系列連載,讓讀者期盼下一篇。
  • 寫作訓練工具:若您是作家或插畫師,可用 AI 生成靈感,再由您精修,作為養成創意能力的練習。

注意事項/實用 Tips

  • 雖然名稱說「免費」,但部分高階功能可能需付費或限制次數,建議先以「免費試用」為起點。
  • 文字提示越具體,畫圖效果越精準。建議描述「色調、光影、角度、背景元素」等。
  • 雖為 AI 產出,仍需您加入「人性化」元素:角色內心、轉折、情感描寫,畫圖也可修圖再發佈。
  • 若將創作商業化,請確認平台的使用條款/商業授權情況。
  • 創作完成後,建議備份作品(文字+圖片),確保資料安全。

參考資訊

https://www.chatartpro.com

如何在手機上用 AI 繪圖?

如何在手機上用 AI 繪圖?

隨著科技的快速發展,人工智能(AI)已經深入滲透到我們日常生活的方方面面。在這個世代,手機已經成為我們生活中不可或缺的一部分。而現在,我們可以利用AI技術在手機上進行繪畫,使創作變得更加輕鬆、有趣和高效。在這篇文章中,我們將探討如何在手機上使用AI進行繪圖,以及如何充分利用這些工具來提高您的藝術技巧,讓你可以離開鍵盤和滑鼠的限制,用手點一點也可以AI繪畫。

直接用現成的APP

機畫師-專業的AI繪畫APP-支持controlNet

有團隊把 Stable Diffusion 的 Webui 做成 APP 給大家使用,需要付費,如果不想用電腦的可以試試看


Pixai.Art

在 Android 上的 AI 繪圖軟體,底層也是採用 Stable Diffusion ,現在也支援 LORA 和 Control Net


Google Colab

用 Google Colab 雲端伺服器來幫忙運算,原則免費,但建議可以付點錢,享受更快更穩,不麻煩的服務

https://colab.research.google.com/github/camenduru/stable-diffusion-webui-colab/blob/main/stable/chillout_mix_webui_colab.ipynb

直接用上面的網址,然後都下一步,就可以建立起自己的 WebUi


Draw Things

https://drawthings.ai/

用 iPhone 上面的資(CPU、GPU),來做AI繪圖,可以離線使用,但手機會很燙,且很耗電


How to run Stable Diffusion on Termux on Android phone

https://ivonblog.com/en-us/posts/android-stable-diffusion/

神人教你如何在 Android 上面安裝自己的 Stable Diffusion Webui ,過程很難,且不是每一隻手機都可以,有興趣的在看看即可

參考資料