by Rain Chu | 8 月 6, 2026 | AI , 影片製作 , 繪圖
MiniMax H3 把文字、圖片、影片和音訊放進同一套生成系統,可以一次產生含有人聲、環境音與音樂的影片,它不只支援文生影片和圖生影片,也能指定首尾幀,或用多張圖片、參考影片與聲音控制角色、運鏡和音色。對本地 AI 影片工作流來說,這比單純追求畫質更重要。
先講結論。MiniMax H3 已經提供可下載權重,也有 ComfyUI 原生模板,但它不是一個只需要 8GB 的小模型。官方精簡量化工作流的主要檔案合計約 39.55GiB。8GB 顯存要依靠模型卸載、系統記憶體和虛擬記憶體,生成速度與穩定度都會受到影響。
MiniMax H3 是什麼
MiniMax H3 是通用型全模態生成系統。它可以理解由文字、圖片、影片和音訊組成的上下文,再共同預測影片與立體聲音訊,官方規格支援 4 到 15 秒、24 FPS、最高 2K 的輸出,並能處理中文、英文、日文、韓文等 11 種較穩定的對話語言。
項目 官方規格 實際意義 輸入 文字、圖片、影片、音訊 可混合角色、場景、動作、運鏡與聲音參考 輸出長度 4 到 15 秒 適合廣告鏡頭、短片段與分鏡 幀率 24 FPS 以電影常用幀率直接產生 本地基礎解析度 短邊 768px 16 比 9 約為 1344 乘 768 2K 透過 H3-Regenerate-2K 目前需要官方服務,完整模組尚未釋出 音訊 32kHz 立體聲 人聲、音效與音樂和畫面共同生成
Reference-to-Video 模式最多可接 9 張圖片、3 段參考影片與 3 段音訊。每段影片或音訊需要介於 2 到 15 秒,所有參考影片的總長度不超過 15 秒,混合輸入最多 12 個檔案。音訊不能單獨作為唯一參考,必須搭配圖片或影片。
Open weights 不等於完整開源
MiniMax H3 比較準確的稱呼是「開放權重」,完整系統由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 組成,目前可在本地執行的是 H3-Base。負責理解複雜多模態素材的 H3-Context-IR,以及把 768p 重新生成為 2K 的 H3-Regenerate-2K 都尚未釋出,只能透過官方 API 使用。
官方也說明,初始版本只提供 full attention 推理,用來降低長序列運算量的 sparse attention 會在後續更新,因此,本地工作流和官方線上 2K 成果不一定完全相同,提示詞越簡略,缺少 Context-IR 的差異越明顯。
H3 的架構為什麼這麼大
H3-Omni-Transformer 是 33B dense 單流 Transformer,其中約 13B 參數位於 AdaLN 相關分支,推理時可以預先計算並快取這些 AdaLN 調制結果,所以 ComfyUI 提供 pruned 版本,把不需要每次載入的權重移除,這就是 pruned INT8 主模型能從完整 BF16 的 61.73GiB 降到約 19.53GiB 的原因。
文字和多模態條件則由 Qwen3-VL 32B 編碼器處理。最後還要載入影片 VAE 與音訊 VAE。因此,H3 不是只下載一個 safetensors 就能運作,而是一組彼此配合的模型元件。
官方精簡量化工作流的四個主要檔案合計約 39.55GiB。檔案可以在運作時分批卸載,但磁碟與系統記憶體仍要保留足夠空間。
元件 建議量化檔 大小 放置目錄 H3 FL2VA 主模型 pruned INT8 ConvRot 19.53GiB models/diffusion_models Qwen3-VL 編碼器 NVFP4 AWQ 14.61GiB models/text_encoders 影片 VAE FP16 4.85GiB models/vae 音訊 VAE FP32 0.56GiB models/vae
如果要使用多參考素材的 R2V 模式,主模型要改成 ref2va 版本,FL2VA 適合文生影片、圖生影片與首尾幀,Ref2VA 才是用角色、動作、運鏡和聲音參考生成新片段的版本,兩套主模型不能混用。
Arena 成績怎麼看
2026 年 8 月初的 Arena 快照中,MiniMax H3 在圖生影片約為 1476 分,在文生影片約為 1455 分,圖生影片和 Seedance 2.0 的差距只有約 2 分,文生影片也進入前段班,由於 Arena 會持續加入新模型與新投票,排名與分數會變動,這組數字只能當作發表初期的參考。
實際價值不只在單張畫面。武俠對話、角色特寫、太空飛行、動態 MV 與商品廣告等案例,最明顯的提升是鏡頭、口型、音效和場景能放在同一條時間軸裡。這和先產生無聲畫面,再交給另一個模型補音效的流程不同。想比較其他本地影片工具,可以延伸閱讀 OpenMontage 本地 AI 影片工作流 。
用 ComfyUI Desktop 安裝 MiniMax H3
最簡單的方法是安裝最新版 ComfyUI Desktop 。官方要求 ComfyUI 0.30.0 或更新版本,啟動後進入 Template Library,選擇 Video,再搜尋 MiniMax H3。可以先從 T2V 或 I2V 模板開始,缺少的官方模型會顯示下載提示。
更新 ComfyUI 到 0.30.0 或更新版本
開啟 Template Library
進入 Video 類別並選擇 MiniMax H3 T2V、I2V 或 R2V
依模板提示下載模型
先將 duration 設為 4 到 6 秒
將 megapixels 設為 0.2 到 0.4 進行預覽
確認人物、動作和聲音正確後,再提高解析度與長度
完整檔案結構如下。實際安裝根目錄會因 Windows、macOS、Linux 和 Desktop 版本而不同,建議從 ComfyUI 選單開啟模型目錄,不要直接照抄別人的 AppData 絕對路徑。
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors
└── custom_nodes/
如果你已經在使用 ComfyUI,可以參考 Krea2 的 ComfyUI 多圖工作流 理解模型目錄與節點連線,想把工作流放到雲端管理,也可以看 RunningHub 與 ComfyUI 工作流平台 。
8GB 顯存真的能跑嗎
有機會啟動,不代表適合長時間使用,8GB 顯存需要把大量權重卸載到系統記憶體,Windows 可能還會進一步使用虛擬記憶體。這會讓 GPU 在運算與資料搬移之間等待,也會增加 SSD 讀寫。解析度、影片長度、參考素材數量和 VAE 解碼都可能造成記憶體尖峰。
8GB 顯存 :從 0.2MP、4 秒和單一參考圖開始,準備充足系統記憶體與 NVMe 空間
12GB 顯存 :較適合 480p 附近的短片預覽,仍需模型卸載
16GB 顯存 :可以嘗試 0.2MP 到 0.4MP,再用影片放大工具處理
24GB 以上 :工作流更實用,但完整 768p 與多參考素材仍要監看記憶體
比較務實的做法是先用 864 乘 480 或更低解析度確認運鏡和角色一致性,再進行高解析重繪或 2K 放大,Sage Attention 也能改善速度,ComfyUI 官方文件表示,在相容硬體與正確 CUDA 環境下,速度可能接近兩倍,但部分層仍會回退到標準 attention。
Qwen3-VL Ultra Heretic H3 不是影片主模型
使用者提供的 Qwen3-VL-32B Ultra Heretic H3 ComfyUI 是 H3 的條件編碼器與提示詞 generation tail,不是 MiniMax H3 的影片生成主模型。它建立在經過 Heretic 修改的 Qwen3-VL 32B 上,主要作用是減少拒答,並在 ComfyUI 裡產生或強化 H3 提示詞。
檔案 用途 大小 Heretic BF16 encoder Qwen3-VL 第 0 到 49 層與完整 vision tower 47.97GiB Heretic INT8 ConvRot encoder 較省記憶體的條件編碼器 24.55GiB INT8 generation tail 第 50 到 63 層、final norm 與 LM head 7.09GiB
只想使用官方 H3,不需要下載這套 Heretic 檔案。要使用提示詞增強器,通常下載 INT8 encoder 與相符的 generation tail,兩個檔案都放到下面的目錄。
ComfyUI/models/text_encoders/H3/
如果還想把這組 encoder 與 tail 當成獨立的本地 Qwen3-VL 文字或視覺模型,需要額外安裝 TextGen 節點。
cd ComfyUI/custom_nodes
git clone https://github.com/ethanfel/ComfyUI-H3-Qwen3VL-TextGen.git
cd ComfyUI-H3-Qwen3VL-TextGen
pip install -r requirements.txt
重新啟動 ComfyUI 後,使用 H3 Qwen VL Generation Tail Loader 和 H3 Qwen VL Generate Text 節點。如果出現 Missing Node Packs,先確認 ComfyUI 已更新,再確認自訂節點資料夾沒有多包一層 ZIP 目錄,最後使用 ComfyUI 自己的 Python 環境安裝 requirements。
Heretic 與解除限制模型的風險
Heretic 類模型會修改拒答行為,但不保證完全移除安全限制,也不保證品質不受影響,模型卡的測試是在 RTX 5090 32GB、特定 ComfyUI commit、PyTorch 2.8 與 CUDA 12.8 環境完成。不同顯示卡與套件版本可能出現完全不同的結果。
把拒答變少不代表產出的內容合法。人物肖像、聲音複製、品牌素材、成人內容和受版權保護的角色都有額外風險。建立公開或商業服務時,應保留內容審查、權限控制與人工確認,不要把解除限制當成跳過責任的工具。
MiniMax H3 提示詞怎麼寫
H3 的提示詞不是堆疊形容詞,而是建立一條可播放的時間軸,先交代整體風格與初始構圖,再依時間描述鏡頭、動作、對話、環境音與配樂,官方建議至少保留三個欄位。
integrated_multimodal_description:
[Shot 1] 真人電影風格,中景。雨夜的老街上,一名穿深色風衣的女子站在霓虹招牌下。攝影機以緩慢的小幅度向前推進。她抬頭看向街口,雨水沿著臉頰滑下。
[Shot 2] At 00:04.000, the camera cuts to a close-up。女子壓低聲音說:<d>[Chinese] 他終於來了。</d> 遠方車燈穿過雨霧,她握緊手中的信封。
overall_soundscape:
持續的雨聲、遠方車流、鞋底踩過積水的聲音。對話清楚,口型與發聲時間同步。
non_diegetic_music:
低沉的大提琴與稀疏鋼琴,緩慢節奏,在第二個鏡頭逐漸提高張力。
第一個鏡頭不需要時間標記。
第二個鏡頭開始使用明確時間,例如 00:04.000。
運鏡最好同時寫出類型、幅度與速度,例如 slow small-amplitude push in。
對話放在 d 標籤裡,並保留語言標記。
環境中真正存在的聲音放在 overall_soundscape,只有觀眾能聽見的配樂放在 non_diegetic_music。
圖生影片要先固定首幀中的人物、服裝、構圖、色彩和空間關係,再描述後續動作。首尾幀模式則要把中間變化寫清楚,不要只寫「從第一張變成第二張」。多參考模式要為每個素材分工,例如 Picture 1 負責人物外觀,Video 1 負責運鏡,Audio 1 負責音色。這類結構化提示詞也可以搭配 Codex 動態圖表與短影片工作流 自動產生。
授權限制一定要先看
MiniMax H3 主模型不是 Apache 2.0,而是 MiniMax H3 Community License,授權適用範圍排除歐盟、英國、韓國與美國,在這些地區部署需要另外聯絡 MiniMax 取得授權,商業產品年營收超過 2,000 萬美元,也需要事先取得書面授權。
商業產品介面還必須清楚顯示 MiniMax H3。授權也禁止用 H3 或其輸出改善其他非 H3 衍生模型。正式上線前應閱讀最新授權全文並取得法律意見,Qwen3-VL encoder 採 Apache 2.0,不代表整套 H3 工作流會自動變成 Apache 2.0。
我的判斷
MiniMax H3 的真正突破不是某一張畫面更漂亮,而是把角色、場景、鏡頭、對話、音效和音樂放進同一個生成過程,這讓本地 AI 影片從「抽一次卡看看」往可規劃的內容製作靠近。
它仍然是一套非常吃資源的系統。8GB 顯存只是能否啟動的最低挑戰,不是舒適規格,想先體驗的人,應從官方 ComfyUI 模板、4 秒、0.2MP 和單一參考圖開始。確認工作流有價值後,再投資記憶體、儲存空間與高解析度後製,Heretic 版本則只適合明白模型用途、授權與安全風險的人使用。
參考資料
FAQ
MiniMax H3 可以用 8GB 顯存執行嗎?
可以嘗試量化模型與 CPU offload,但要準備足夠的系統記憶體、虛擬記憶體和 NVMe 空間。建議從 0.2MP、4 秒短片開始,8GB 並不是官方保證的舒適規格。
MiniMax H3 本地可以直接產生 2K 嗎?
目前完整的 H3-Regenerate-2K 尚未開放。本地 H3-Base 主要輸出短邊 768px,官方 2K 品質仍需要搭配 API,或使用第三方放大與重繪工具。
Qwen3-VL Ultra Heretic H3 是 MiniMax H3 主模型嗎?
不是。它是 H3 使用的 Qwen3-VL 條件編碼器與 generation tail,負責提示詞理解和生成。真正產生影片的是 FL2VA 或 Ref2VA diffusion model。
MiniMax H3 可以商用嗎?
可以在授權適用地區依社群授權使用,但歐盟、英國、韓國與美國被排除。年營收超過 2,000 萬美元的商業產品需要事先取得書面授權,產品介面也要顯示 MiniMax H3。
ComfyUI 顯示 Missing Node Packs 怎麼辦?
先更新 ComfyUI,再確認自訂節點放在 custom_nodes 的第一層,並用 ComfyUI 自己的 Python 安裝 requirements。重新啟動後仍缺節點,再依節點名稱安裝對應的 node pack。
by Rain Chu | 7 月 12, 2026 | AI , 影片製作
Seedream 5.0 Pro 這次最值得注意的地方,不是「又一個更會畫圖的模型」而已。真正的主線,是它把圖像生成、圖像編輯、素材可信任度和後續圖生影片流程接在一起。換句話說,它是在替 Seedance 2.0 這類影像生成流程準備更乾淨、更可控的前置素材。
如果只把它拿來和 GPT Image 或其他圖像模型比美感,會漏掉一半重點,Seedream 5.0 Pro 的定位更像是「可控素材製作工具」,它適合處理商品圖、人物一致性、材質替換、局部修改與多圖參考,也適合被接進 RunningHub 這類 ComfyUI 工作流平台 裡,變成可重複使用的內容流程。
三個核心方向
Seedream 5.0 Pro 的核心方向可以拆成三個
第一是讓圖像編輯更可控,而不是只靠模型自由發揮。
第二是用更模組化的方式提供相對低成本的生成與編輯能力。
第三是讓圖片到影片的路徑更順,特別是和 Seedance 後續版本的銜接。
這三點合起來看,會發現它不是單點功能升級,而是完整內容管線的鋪路,先用 Seedream 5.0 Pro 生成或修好圖片,再把圖片丟進圖生影片模型,理論上可以減少人臉、素材可信任度和審核卡關的問題。這也是為什麼它比一般文生圖模型更值得追。
可控編輯比自由生成更重要
這次最明顯的提升,是局部編輯的可控性。舉例來說,把圖片中的某個玩偶換成另一個物件,或用簡單標記指定要改的區域,Seedream 5.0 Pro 能比較自然地把新物件融入原場景。光影、材質、邊緣融合和背景一致性,是它比較有競爭力的地方。
這對電商圖片很重要,商品圖最怕的是物件看起來像後貼上去,或材質和場景不一致,Seedream 5.0 Pro 比較像是在理解「這個材質應該如何存在於場景裡」,而不是只是把 prompt 文字翻成圖片。
但它也不是萬能,越抽象的概念、越複雜的排版設計、越需要策略性構圖的封面設計,它和 GPT Image 這類模型還是有差距,我的判斷是,Seedream 5.0 Pro 更像 Nano Banana 類型的競爭者,強在可控編輯與素材處理,GPT Image 則更強在理解任務、設計整體版面和處理抽象需求。
材質還原是電商場景的亮點
Seedream 5.0 Pro 對材質的理解很值得注意。測試裡包含服裝布料、球衣、禮服、玩偶、沙發和花材替換,整體看起來比較能保持原本場景的光線與質感。尤其是給定材質參考圖和顏色參考圖時,它能把要求融合到新圖片裡。
這代表它不只是能「換一個東西」,而是能更接近「照著品牌材質和色彩規範換一個東西」。對商品主圖、社群宣傳圖、服裝搭配、場景圖來說,這會比單純漂亮更實用。
用途 Seedream 5.0 Pro 的優勢 還要注意 商品圖修圖 材質融合與局部替換自然 需要確認商品真實性與授權 人物一致性 臉、服裝和場景一致性提高 肖像權與真人仿真風險要先處理 多圖參考 可以吸收材質、顏色與風格參考 參考圖太多時仍可能混亂 設計排版 基礎美感變好 抽象概念和版面設計仍不是最強項
為什麼它其實是在幫 Seedance 2.0 鋪路
最有意思的是圖生影片這條線。過去很多 AI 影片工作流的問題,不是影片模型完全不行,而是前置圖片太容易出現臉不穩、素材不被信任、提示詞被擋、或圖片本身和影片模型不匹配。Seedream 5.0 Pro 若能產生更容易被後續流程接受的素材,整個圖生影片鏈條就會順很多。
這也是為什麼我會把它和 AI 動畫分鏡工具 、OpenMontage 這類本地 AI 影片工作流 放在同一條線上看。未來的內容生產不是單一模型決勝負,而是「圖像模型負責前置素材」「影片模型負責運動」「工作流平台負責串接」。
Seedance 2.0 或後續版本真正要跑得順,前面就需要一個能把人物、商品、材質和場景先整理好的工具。Seedream 5.0 Pro 在這裡扮演的角色,比單純文生圖更關鍵。
目前限制也很明顯
Seedream 5.0 Pro 已經有幾個強項,但限制也不能忽略。抽象概念測試仍不穩,例如要求產出大量不同姿勢或不同表情的頭像格,有時會出現重複動作、理解偏差或排列不如預期。這代表它在「規則化輸出」和「多元素差異控制」上還沒有完全成熟。
設計排版也仍然不是它最強的地方。如果要做品牌封面、資訊圖、海報版面,GPT Image 類模型可能仍然更聰明。Seedream 5.0 Pro 比較適合先做圖像素材,再交給其他設計流程處理版面。
另外還有兩個功能值得觀望。第一是 4K 原生版本。第二是分層能力。分層對設計工作很關鍵,因為它會影響後續能不能像 Photoshop 一樣調整物件、文字、背景與光影。若分層真的穩定開放,Seedream 5.0 Pro 的定位會從圖像模型更靠近設計工具。
RunningHub 工作流怎麼用
說明欄提供了幾個 RunningHub 工作流,包含 Seedream 5.0 Pro 文生圖、Seedream 5.0 Pro 圖像編輯,以及全能圖片 G2 圖像編輯。對不想先處理本地部署的人來說,這種方式最快。你可以先用線上工作流測它是否符合自己的內容需求,再決定要不要進一步研究本地化或自動化。
如果你偏向本地工具鏈,也可以把這次的思路和 ComfyUI 本機部署 AI 繪圖模型 對照。線上工作流省部署,本機部署則更可控。兩者沒有誰一定比較好,差別在你要速度、隱私、成本,還是可調參能力。
我的使用判斷
Seedream 5.0 Pro 值得試,尤其是你有商品圖、人物素材、服裝材質、社群圖片和圖生影片需求。它不是最會做排版的模型,也不是最會理解抽象創意的模型,但它在「把現有素材改得更可用」這件事上很有價值。
我會把它放在 AI 內容生產流程的前段。先用它把人物、商品、材質、色彩和構圖穩住,再接到影片模型或設計工具。這種位置比單純追求一張漂亮圖更實際,也更接近未來 AI 工作流的方向。
至於要不要立刻大量投入,我會等兩件事。第一,4K 原生版本穩不穩。第二,分層功能是不是真的能用在設計流程裡。如果這兩個功能落地,它就不只是又一個圖像模型,而會更像一個能接進商業工作流的圖像基礎工具。
by Rain Chu | 7 月 11, 2026 | AI , 圖型處理 , 影片製作
RunningHub 最值得看的地方,不是它又做了一個線上 AI 繪圖平台,而是它把 ComfyUI 工作流、AI 應用、模型 API、工作流 API 和內容模板包成一個可營運的創作平台。對內容團隊來說,這比較像是把原本散在本機、模型網站、工作流社群和 API 文件裡的能力,整理成同一個生產入口。
如果你之前已經在玩 本機 ComfyUI 與開源繪圖模型 ,RunningHub 可以看成另一條路。它不是要求每個人都先理解節點、環境、顯卡和模型路徑,而是把工作流託管在雲端,讓創作、分享、調用和商業化更接近一般工具的使用方式。
RunningHub 是什麼
RunningHub 官方把自己定位成原生 AI 智能體驅動的全能內容創作平台,支援 ComfyUI 工作流、無限畫布、AI 應用和模型 API 調用。這句話拆開看,其實代表三層產品。
第一層是創作入口,包含快捷創作、無限畫布、rhTV、RHSTORY、VibeX 和各種模板。
第二層是工作流市場,讓創作者基於 ComfyUI 做出可複用的流程,並提供給其他人直接使用。
第三層是 API 與開發者工具,把模型、AI 應用和工作流變成可以被產品或內部系統調用的服務。
這三層合在一起,RunningHub 的野心就比較清楚了,它不是只想做一個 ComfyUI 雲端版,而是想做 AI 內容生產的基礎平台。創作者可以在上面做模板,團隊可以用模板產出素材,開發者可以透過 API 把同一套能力接到自己的產品裡。
和本機 ComfyUI 最大差別
本機 ComfyUI 的好處是自由度高,模型和節點都能自己控制,缺點也很明顯,安裝、模型管理、節點衝突、顯卡限制和工作流維護都會吃掉大量時間。RunningHub 則把這些麻煩轉成雲端服務與平台規則。
面向 本機 ComfyUI RunningHub 環境管理 自己安裝 Python、節點、模型和驅動 平台託管工作流與模型能力 硬體成本 需要自己的 GPU 或雲端機器 按平台資源與調用方式使用 分享方式 通常分享 JSON、模型清單與安裝說明 可直接變成模板、AI 應用或 API 適合對象 技術玩家、研究者、重度創作者 內容團隊、電商、短劇、行銷、開發者 商業化路徑 需要自己包服務或教學 平台內有模板、應用與創作者激勵
這和 Liblib 這類中國 AI 創作平台 很像,都是把模型能力、創作者生態與素材生產流程放進平台。差別在於 RunningHub 特別強調 ComfyUI 工作流、AI 應用和 API 的連動,對想把流程產品化的人更有吸引力。
工作流才是核心資產
RunningHub 的 ComfyUI 頁面不是只展示模型,而是展示大量工作流。像商品圖、角色設計、短劇分鏡、動作模仿、去水印、高清修復、影片超分、圖生影片等,都不是單一模型能解決的問題,而是由多個節點和步驟組成的流程。
這一點很重要。AI 內容創作正在從 prompt 時代走向 workflow 時代。單次生成可以靠運氣,多次穩定產出就需要流程。誰能把流程沉澱成模板、應用和 API,誰就更接近可複製的生產力。
這也能和 OpenMontage 本地影片工作流 放在一起看。一邊是本地自架、可控性更高,另一邊是平台化、上手更快。真正要選哪一邊,不是看哪個比較酷,而是看團隊需要的是控制權,還是交付速度。
API 讓 RunningHub 不只是一個網站
RunningHub 的 API 頁面有一個關鍵說法,單一接口可以直連 400 多個主流大模型。它也把能力拆成模型 API、AI 應用 API 和工作流 API。這代表開發者不一定要讓使用者進 RunningHub 網站操作,也可以把平台能力接進自己的產品。
官方列出的生產環境重點包括全模態聚合、工作流託管、彈性按需計費與企業級安全。這幾個詞不是行銷話術而已。對公司來說,真正麻煩的往往不是模型能不能跑,而是能不能穩定調用、能不能控權限、能不能算成本、能不能把工作流變成內部服務。
RunningHub 也提供 RH_CLI、RH_Skills、ComfyUI 插件與 AI Developer Kit。這些工具的意義是降低接入門檻。創作者可以從平台模板開始,工程團隊則可以把流程變成自動化服務。這和 AI 代理走向工作平台 是同一個方向,重點不只是模型,而是把模型放進可用的工作系統。
哪些人最適合用 RunningHub
我會把 RunningHub 的使用者分成四類。
電商與品牌團隊,需要大量商品圖、短影片、模特圖、場景圖和廣告素材。
短劇與內容團隊,需要分鏡、角色、場景、動作模仿和影像增強。
ComfyUI 創作者,想把自己的工作流變成模板、應用或可被調用的服務。
開發者與企業團隊,想用 API 把模型和工作流接進既有系統。
如果只是偶爾玩圖,本機工具或單一模型網站就夠了。如果是每天要產內容、測素材、上架商品、做短劇或替客戶交付,RunningHub 這種平台化工具才會開始有價值。因為它解決的不是單張圖,而是內容生產流程。
我會怎麼開始測
第一步不要先研究所有功能,而是挑一個真實任務。例如電商商品圖、短劇分鏡、社群廣告短片或角色一致性測試。用官方模板跑出第一版,記錄效果、成本和可修改程度。
第二步才是比較工作流。看同一個任務能不能換模型、改節點、調提示詞、保留角色一致性,或直接變成 AI 應用。這一步能判斷 RunningHub 是臨時工具,還是能進入你的固定流程。
第三步看 API。如果你要把內容生產接到網站、內部後台、自動化任務或客戶服務流程,工作流 API 才是長期價值。這時候就要評估調用成本、回傳格式、權限控管和失敗重試。
我的結論
RunningHub 的定位很清楚,它想把 ComfyUI 從高手工具變成內容生產平台,這件事不只是降低門檻,也是在改變 AI 創作的價值重心。過去大家比的是誰會寫 prompt,現在會慢慢變成誰能設計穩定工作流,誰能把工作流包成應用,誰能把應用接成 API。
如果你只想偶爾生成圖片,RunningHub 可能會顯得太大。如果你在做短劇、電商、廣告素材、品牌內容或 AI 工具產品,它就很值得看。因為它賣的不是單次生成,而是從創作、模板、工作流到 API 的整套生產鏈。
延伸資源
FAQ
RunningHub 是什麼?
RunningHub 是一個 AI 內容創作平台,整合 ComfyUI 工作流、AI 應用、無限畫布、模型 API 和工作流 API,適合把圖像、影片和內容流程平台化。
RunningHub 和本機 ComfyUI 有什麼差別?
本機 ComfyUI 自由度高,但需要自己管理環境、模型和顯卡。RunningHub 把工作流和模型能力雲端化,適合需要快速創作、分享模板、建立 AI 應用或調用 API 的團隊。
RunningHub 適合哪些場景?
它適合電商商品圖、短劇分鏡、品牌素材、影片生成、角色一致性、高清修復,以及把 ComfyUI 工作流變成可重複調用的內部工具或 API 服務。
by Rain Chu | 7 月 8, 2026 | AI , 影片製作
OpenMontage 最吸引我的地方,不是「一句話自動做完 AI 影片」這種口號,而是它把 AI 影片製作拆成一套比較像真實片廠的工程流程:研究、提案、腳本、分鏡、素材、剪輯、合成、檢查,全部交給 coding agent 去編排。
這件事有意思,因為現在很多 AI 影片工具其實只是在「生成幾段畫面」或「把幾張圖做動」, OpenMontage 的方向不太一樣,它把影片看成一個專案,而不是單一模型輸出, 你可以用生成式素材,也可以走免費素材檢索,也可以讓 Remotion、HyperFrames、FFmpeg、TTS、字幕工具一起工作。
如果你之前看過我寫的 HyperFrames 用 HTML 寫影片 ,OpenMontage 可以理解成更上層的總控:HyperFrames 或 Remotion 是渲染舞台,OpenMontage 則負責決定要演哪一齣、需要哪些素材、哪個管線比較適合。
先講結論:它不是單一工具,而是一套 agentic video workflow
OpenMontage 官方把它定位成 open-source agentic video production system。
這句話翻成白話就是:你不是打開一個剪輯軟體慢慢拉時間軸,而是把需求丟給 AI coding assistant,讓它在專案裡呼叫一串工具,最後產出可渲染的影片專案。
它目前主打 12 條 production pipelines、52 個 production tools、數百個 agent skills。這些數字先不用神化,真正重要的是架構:OpenMontage 把「做影片」拆成管線選擇問題。要做動畫解說、紀錄片蒙太奇、動態文字、產品廣告、Podcast repurpose、字幕翻譯,走的流程不應該一樣。
這也很符合我對 AI Agent 的看法。真正能落地的 Agent,不是一直聊天,而是能選工具、讀檔、跑命令、檢查輸出、失敗後改路線。這點跟我前面整理過的 Ornith 35B 與 Hermes 工作流 是同一個方向:模型不是主角,流程控制才是主角。
本地部署的基本盤:Python、Node、FFmpeg,再加一個 AI coding assistant
OpenMontage 的安裝門檻不算低,但也沒有到很誇張。官方 README 的 Quick Start 是:
git clone https://github.com/calesthio/OpenMontage.git
cd OpenMontage
make setup
如果是在 Windows 環境,配套筆記把步驟拆得更實際:先裝 Git、Python 3.11、Node.js;建立 venv;安裝 Python requirements;進 remotion-composer 跑 npm install;再預熱 HyperFrames。簡化後大概是這樣:
git clone https://github.com/calesthio/OpenMontage
cd OpenMontage
python -m venv venv
venv\Scripts\activate
python -m pip install -r requirements.txt
cd remotion-composer
npm install
cd ..
npx --yes hyperframes --version
OpenMontage 不是只有 Python 腳本,它會用 Remotion 做 React 影片渲染,也會用 HyperFrames 做 HTML/GSAP 類型的動態文字與 motion graphics,也就是說,它本質上是一個跨 Python、Node、前端渲染、影音處理的混合專案。
如果你本來就在研究 AI 影片生成模型,可以延伸看 Wan 2.1 的整理 ,OpenMontage 不是要取代這些模型,而是把模型、素材庫、TTS、剪輯和渲染器放進同一條可控流程。
零 API Key 可以玩,但不要把零成本理解錯
OpenMontage 官方 README 有一段很重要:沒有付費 API key 也能做東西。它可以用 Piper TTS、本地字幕、FFmpeg、Remotion、HyperFrames,以及 Archive.org、NASA、Wikimedia Commons 這類開放素材來源,配套筆記則建議本地中文配音可以接 dots.tts,走 OpenAI 相容的本地 API 服務。
但我會把這件事講精準一點:零 API Key 不等於零成本。你省下的是雲端生成 API 的帳單,但仍然有時間成本、硬碟成本、顯卡成本、網路下載成本,以及 Agent 跑錯路線後的重跑成本。
比較正確的理解是:OpenMontage 讓你有機會把成本從「每次生成都付費」改成「本地工具與免費素材優先,必要時才接付費 provider」。這也是我喜歡本地 AI 工作流的原因,重點不是假裝不用花錢,而是你可以決定錢花在哪裡。
如果你對本地 TTS 有興趣,可以接著看 VoxelCPM 本地 TTS 與離線部署 。OpenMontage 這類工具能不能舒服使用,中文配音品質其實會大幅影響成品觀感。
三條路線:生成類、檢索類、動態文字類
真正開始用 OpenMontage 時,我覺得要先把題目分成三種,不要一律丟給同一條管線。
生成類 :適合知識動畫、概念解釋、抽象主題。重點是腳本、旁白、視覺生成與字幕。
檢索類 :適合森林、海浪、城市、科技感、自然景觀這種通用氛圍題。重點是免費素材庫與剪輯節奏。
動態文字類 :適合頻道預告、產品短片、宣傳片、資訊卡。重點是排版、節奏、字卡與音樂。
這裡最大的坑是「題目和管線不匹配」。例如你想做歷史事件、特定人物、某次火箭發射、某個實驗室場景,免費素材庫不一定找得到精準畫面。這種題目硬走檢索管線,很容易找到一堆氣氛接近但內容對不上的 B-roll。
相反地,如果題目是「地球的呼吸」「雨夜城市」「森林甦醒」這類氛圍型主題,檢索管線就很適合。因為它不需要某個唯一正確鏡頭,只要找到情緒與節奏對的真實素材,就能剪成一支完整作品。
這點也可以和 OiiOii 動畫分鏡工作流 放在一起看。AI 影片的關鍵不只是模型,而是你能不能在生成前就把「題目、鏡頭、節奏、素材來源」講清楚。
OpenMontage 最值得記下來的 6 個坑
這次配套筆記最有價值的地方,是把幾個踩坑點寫得很直接。我整理成實作時應該先記在旁邊的清單。
不要亂加逐詞字幕。 動畫解說如果要求逐字、逐詞字幕,切詞可能會很碎。普通字幕反而比較乾淨。
檢索管線要避開大規模 corpus builder。 直接把 NASA、Archive.org 整段抓下來建語料庫,很容易下載失控。快速路線是 direct_clip_search,只用 Pexels / Pixabay,720p,限制槽位。
不要讓 Agent 自己亂翻中文搜尋詞。 檢索素材時,最好把每個鏡頭先翻成 5 個字以內的英文短語,例如 misty forest valley、ocean waves、city rain night。
提示詞會影響管線選擇。 如果你寫「科普、旁白、TTS、中文字幕」,系統很可能走 animated-explainer;如果你要真實素材蒙太奇,就要明確寫 documentary montage、real footage only、direct_clip_search、no narration。
8GB 顯卡不適合硬衝本地影片生成。 能塞進去的模型選擇有限,還要 CPU offload,最後可能等很久只得到短短幾秒低解析片段。
免費素材路線適合通用題,不適合特定命名物。 森林、城市、海浪很好找;某個具名歷史場景或特定設備就不要硬搜。
OpenMontage 現階段最合理的期待值:可以跑通,可以做出東西,但要用對題目、用對管線、不要期待它第一次就像成熟商業剪輯工具。
我會怎麼下 prompt:先鎖管線,再鎖素材來源
OpenMontage 不是越自由越好用。你如果只寫「幫我做一支很酷的 AI 影片」,Agent 會需要猜太多東西:要不要旁白?要不要真實素材?要不要生成圖片?要不要字幕?要用 Remotion 還是 HyperFrames?
比較穩的 prompt 應該長這樣:
製作一支 60 秒紀錄片蒙太奇,主題是「地球的呼吸」。
管線:documentary-montage。
素材:只用真實素材,只從 Pexels / Pixabay 搜尋,走 direct_clip_search,不要 Archive.org,不要 NASA,不要 corpus_builder。
音訊:不要旁白,只放背景音樂。
畫面:720p,10 個素材槽位。
搜尋詞:每個槽位用我給的英文短語,不要自行改寫。
輸出:Remotion 渲染,三段中文畫面文字卡,淡入淡出。
如果要做動態文字宣傳片,就要反過來鎖死:不要檢索、不要生成圖片、全部用程序化排版文字、渲染引擎用 HyperFrames/GSAP。這樣 Agent 才不會跑去找素材,或突然把簡單字卡做成一堆不必要的生成圖。
這也是我覺得 OpenMontage 適合搭配 Codex 這類 coding interface 的原因。它需要的是能讀專案、跑命令、改檔案、看錯誤、重新執行的環境,不只是單純聊天介面。
8GB 顯卡可以玩嗎?可以,但不要從本地影片生成開始
本地影片生成性價比偏低,Wan2.1-1.3B 這類模型可以勉強塞,但要開 CPU offload;輸出通常短、解析度不高,等待時間也不短。圖生影片若不小心切到更大的 14B 模型,8GB 顯卡直接爆掉也不奇怪。
所以如果你的硬體只有 8GB VRAM,我會建議先走三條比較務實的路:
用免費素材庫做真實素材蒙太奇。
用 Remotion / HyperFrames 做程序化動畫與動態文字。
把本地 TTS、字幕、剪輯、自動化流程先跑順。
等流程穩了,再評估要不要加付費 API 或升級硬體,如果你正在考慮 AI 工作站,RTX PRO 6000 Blackwell 顯卡選購 那篇可以搭配看,OpenMontage 這種工作流很吃「整體系統」,不只是顯卡型號而已。
適合願意把影片當工程專案的人
OpenMontage 現在比較適合三種人。
第一種是技術型創作者 :你願意看 log、改 prompt、裝依賴、調管線,OpenMontage 會給你很大的控制權。
第二種是想把內容流程自動化的人: 例如固定產出知識動畫、短片、宣傳片、字幕版本,這套管線可以慢慢沉澱成自己的模板。
第三種是正在研究 AI Agent 的人: OpenMontage 很適合觀察 Agent 如何做工具選擇、階段驗證、失敗重試與輸出檢查。
但如果你期待的是「打一句話、三分鐘後給我商業級成片」,它目前不會是最好的選擇,它更像一個正在快速演化的開源片廠骨架,需要你願意進去調教。
資源與安全連結整理
OpenMontage 的價值在「可編排」,不是魔法
我會把 OpenMontage 看成 AI 影片製作的 agentic framework,而不是一個單純的 AI 影片生成器。它真正有價值的地方,是把影片製作拆成可選管線、可替換工具、可檢查輸出的流程。
它現在最適合的打法,是先從零 API Key 或低成本路線開始:本地 TTS、免費素材庫、Remotion、HyperFrames、FFmpeg,等流程跑通,再依照題目決定要不要加 Veo、Kling、FLUX、OpenAI TTS 或其他 provider。
一句話總結:OpenMontage 不是把創作變成不用思考,而是把創作變成可以被 Agent 執行、被人類審核、被工程流程反覆改進的系統。這條路如果走通,AI 影片工具會從「生成一段畫面」進化成「管理一個製作流程」。
FAQ
OpenMontage 是什麼?
OpenMontage 是一套開源的 agentic video production system,讓 AI coding assistant 透過管線方式處理研究、腳本、素材、剪輯、渲染與檢查,不只是單一影片生成模型。
OpenMontage 可以不用付費 API Key 嗎?
可以。它可以使用本地 TTS、免費素材庫、Remotion、HyperFrames、FFmpeg 等工具先跑出作品。不過零 API Key 不等於零成本,仍然有硬體、時間、下載與維護成本。
OpenMontage 適合用在哪些題目?
通用氛圍類題目適合走真實素材檢索,知識解釋適合走動畫解說,產品或頻道宣傳適合走動態文字。特定歷史事件、具名人物或稀有場景,不適合硬走免費素材檢索。
by Rain Chu | 7 月 7, 2026 | AI , 影片製作
AI 影片工具正在從「生成一段漂亮畫面」往「協助完成一套可控工作流」移動。OiiOii 主打的不是單純丟一句提示詞生成影片,而是協助創作者把故事拆成分鏡,再銜接 AI 動畫生成工具,讓短影音、廣告概念片或角色動態 demo 更快進入可測試階段。
圖:AI 動畫分鏡與多 Agent 工作流示意
OiiOii 真正吸引人的地方:先做分鏡,再做動畫
多數 AI 影片工具最大的痛點,不是「能不能生成」,而是「能不能穩定重複出接近導演想法的畫面」。一支看起來完整的動畫,通常需要角色設定、場景氣氛、鏡頭運動、景別切換、節奏、轉場與連續性。如果每一幕都靠手動提示詞硬拚,創作者很快就會被版本管理與反覆修稿拖住。這也是為什麼單看 AI 影片生成工具 的畫質還不夠,前期分鏡與流程設計會直接影響成片穩定度。
OiiOii 這類工具的價值,正在於把「動畫生成」前面那一段拆解工作流程化:先把概念拆成可執行的分鏡,再把每個鏡頭轉成更具體的生成指令。對短影片創作者來說,這可以降低起步門檻;對已經熟悉剪輯與分鏡的人來說,它則像是一個快速前期製作助手。
OiiOii 的核心功能亮點
OiiOii 的核心不是把一句提示詞變成一段漂亮畫面,而是把 AI 動畫創作中最難控的「分鏡」拉到流程中心。真正讓一支動畫短片成立的,通常不是單張畫面多精緻,而是鏡頭如何切換、情緒如何遞進、角色與場景如何在不同畫面之間保持連續。
在實際創作流程上,OiiOii 先讓創作者選擇視覺方向,再把故事概念拆成可操作的生成任務。它的風格庫涵蓋 AI 真人、上海美術電影、Kpop 女團 CG 風等方向,也包含真人、3D、2D 等不同類型。對創作者來說,這代表一開始就能先確定影像語氣,而不是等生成失敗後才回頭修正風格。
比較值得注意的是它的多 Agent 流程。OiiOii 把前期製作拆給不同角色處理,像是藝術總監、編劇、設計師等;流程會先確認片長與情緒關鍵字,再進到劇本轉寫、人物場景生成與分鏡設計。這讓它更像是一套「陪你完成前期製作」的協作系統,而不是只把提示詞丟給影片模型。若把它放到更大的 AI 工作流 脈絡來看,它處理的是創意落地前最容易失控的拆解階段。
分鏡編輯是另一個關鍵亮點。創作者可以用多圖參考模式先生成分鏡圖,再針對單一格子修改;例如角色朝向不對時,不必整張重做,而是選中那一格、輸入提示詞修正。更關鍵的是,分鏡提示詞可以細到秒,包含角色聲音、每一秒音效與情緒設計;這正是它和傳統「一次生成一段影片」工具的差別。
它比較適合誰?
想快速測試 AI 動畫概念,但還沒有成熟分鏡能力的創作者。
需要把腳本拆成多個鏡頭,再交給 Seedance、即夢或其他 AI 影片模型生成的人。
正在製作短影音、MV 概念片、產品廣告草案、角色展示片的人。
想把「一句提示詞」升級成「可反覆修改的工作流」的人。
但如果你的需求是完全精準的商業級動畫,或每一個鏡頭都要有高度可控的表演、構圖與轉場,這類工具目前更像是加速器,不是全自動替代品。
使用前要注意的成本與限制
這類工具最容易被行銷成「一鍵爆款」,但實際導入前更應該先評估成本、穩定性與售後支援。需要注意的問題包括:流程中仍可能遇到 bug,補償與客服體驗不一定成熟;費用也未必會比即夢等工具低,而且生成、修改、重跑每一步都可能產生成本。這代表它並不是免費魔法,而是一套需要評估投入產出的製作流程。
另一個關鍵提醒是:即使工具能把流程模組化,最後仍然需要創作者自己把提示詞、鏡頭語言與修改方向寫清楚。分鏡工具可以幫你建立骨架,但骨架能不能長出好看的影片,仍取決於題材設定、審美判斷與反覆調整。
和即夢、Seedance 這類工具的關係
OiiOii 更適合被理解成創作流程中的「前期規劃與工作流層」,而不是單一底層影片模型。你可以把它理解成:OiiOii 協助你想清楚鏡頭與分鏡,Seedance 或其他影片模型負責生成具體影像。
這種分工會越來越常見。AI 影片模型越強,越需要上層工具幫創作者管理腳本、鏡頭、角色一致性與生成參數。真正的競爭點不只是哪個模型畫面最漂亮,而是誰能讓創作者用更少試錯完成更穩定的作品。像 AI Agent 自動剪輯 這類工具,也是在把影片創作從單點生成推向可編排、可重複的流程。
使用前可以先問自己的 5 個問題
我需要的是靈感 demo,還是可交付的商業成片?
每個鏡頭反覆生成的費用,是否在可接受範圍內?
我是否有能力判斷分鏡、轉場與節奏好壞?
如果工具產生 bug 或結果不穩,是否有備用流程?
我是否已準備好角色設定、故事大綱與視覺參考?
如果這五題都答得出來,OiiOii 這類工具就值得測試;如果還答不出來,建議先用一個短腳本做小規模實驗,不要一開始就把完整專案押上去。
爆款不是按鈕,分鏡才是槓桿
OiiOii 值得注意的地方,不是它承諾「一鍵爆款」,而是它碰到 AI 影片創作真正的瓶頸:如何把創意拆成可執行、可修改、可重複的鏡頭流程。對創作者來說,這比單次生成一段炫技畫面更重要。
目前更務實的看法是:把 OiiOii 當成 AI 動畫前期製作助手,而不是全自動導演。它能幫你縮短分鏡與試片時間,但成本、bug、提示詞品質與剪輯判斷仍然需要人來掌控。真正能產出好作品的,不會只是會按生成鍵的人,而是能把故事、鏡頭與工具串成完整工作流的人。
FAQ
OiiOii 是 AI 影片模型嗎?
OiiOii 更像是協助 AI 動畫分鏡與工作流規劃的工具,不一定等同於底層影片生成模型。
OiiOii 適合新手嗎?
適合用來快速理解分鏡流程與測試短片概念,但新手仍需要學會提示詞、鏡頭語言與基本剪輯判斷。
使用 OiiOii 會不會很貴?
使用這類工具時,每一步生成、修改與重跑都可能產生成本,費用也未必會比即夢等工具低。建議先用短腳本測試,再決定是否投入完整專案。
by Rain Chu | 6 月 14, 2026 | AI , 影片製作
HyperFrames 是 HeyGen 推出的開源影片製作框架,核心概念是把影片當成網頁來寫,再渲染成 MP4 影片 。
HyperFrames 改成用 HTML、CSS、JavaScript 來描述畫面與動畫。也就是說,標題、圖片、影片片段、字幕、轉場、背景音樂,都可以像寫網頁一樣被組合起來,再由系統渲染成正式影片。
它最大的特色,是專門為 AI coding agent 設計。使用者可以搭配 Claude Code、Cursor、Gemini CLI、Codex 等工具,只要用自然語言描述想要的影片,例如:「做一支 10 秒產品介紹影片,加入淡入標題、背景影片和音樂」,AI 就可以產生對應的 HyperFrames 專案、HTML 結構、動畫設定,並協助預覽與輸出。
HyperFrames 適合的應用包括產品介紹影片、社群短影音、簡報轉影片、PDF 轉說明影片、CSV 資料動畫、圖表競賽影片、字幕動畫、網站展示影片,以及自動化內容生產流程,對於想要建立大量短影音模板、AI 行銷內容流程,或把影片製作變成可重複執行 pipeline 的團隊來說,這是一個很值得關注的工具。
簡單來說,HyperFrames 不是一般的無程式碼剪輯工具,而是「影片即程式碼」的製作方式。它讓影片可以被版本控制、被 AI 修改、被自動化產生,也更容易整合到內容生產系統中。
安裝
安裝方式也很直接,要搭配 AI agent,可以使用:
npx skills add heygen-com/hyperframes
如果要手動建立影片專案,可以使用:
npx hyperframes init my-video
cd my-video
npx hyperframes preview
npx hyperframes render
參考資訊
近期留言