Select Page
LTX 2.3 本地部署教學:8GB 顯卡用 ComfyUI 生成同步影音

LTX 2.3 本地部署教學:8GB 顯卡用 ComfyUI 生成同步影音

LTX 2.3 把畫面、聲音、人物動作與鏡頭運動放進同一套生成流程,還能透過 ComfyUI 在本機執行,對只有 8GB 顯存的使用者來說,社群 GGUF 量化工作流確實打開了一扇門,但「能跑」不等於完整模型全放進顯存,也不代表每台電腦都能在不到一分鐘內完成。

我會把 LTX 2.3 定位成一個適合實驗同步影音、角色短片與圖生影片的本地模型,它可以成為 OpenMontage 本地 AI 影片工作流裡的生成引擎,也可以獨立放在 ComfyUI 裡反覆調整。真正要先弄清楚的,是權重版本、顯存、系統記憶體與工作流之間的關係。

LTX 2.3 改進了什麼

LTX 2.3 官方頁面把這次更新整理成幾個核心方向。新的 VAE 改善髮絲、材質與邊緣細節,較大的文字連接器能理解多主體、空間關係、動作與鏡頭指令,圖生影片減少了畫面凍結與只做平移縮放的情況,音訊也換上新的 vocoder,降低雜音、靜音缺口與突然中斷。

  • 支援文生影片與圖生影片
  • 能在同一個流程生成畫面與同步音訊
  • 改善人物微表情、動作與鏡頭運動
  • 原生支援最高 1080×1920 的直式影片
  • 提供完整權重、Distilled、FP8 與社群量化方案

官方也提醒,LTX 2.3 採用新的 latent space,舊版 LoRA 不能直接當成完全相容的資產,通常需要重新訓練。這點比單純更新模型檔更重要,已經累積大量 LTX 2 工作流的人要先做相容性測試。

8GB 顯卡能跑,但要先拆掉一句話裡的誤會

官方 ComfyUI 文件把標準本地工作流的前置條件列為 32GB 以上顯存與 100GB 以上可用磁碟空間。8GB 顯卡路線使用的是社群 GGUF 量化權重、模型卸載與系統記憶體,不是把 BF16 完整權重硬塞進 8GB 顯存。

版本適合用途主要取捨
BF16 Dev品質驗證與正式輸出硬體需求最高
Distilled快速迭代與工作流測試速度優先
FP8較低顯存的官方量化路線品質與資源需求折衷
GGUF Q4 或 Q58GB 到 16GB 顯存的社群工作流依賴 CPU offload、系統記憶體與相容節點

QuantStack 的 LTX 2.3 GGUF為例,Q5_K_S 檔案約 18.5GB,已經大於 8GB 顯存。能在 8GB 顯卡執行的關鍵,是工作流不要求所有資料同時留在 GPU。代價是更吃系統記憶體與資料搬移時間。想進一步理解 GGUF 與量化的角色,也可以對照站內的本地模型推理框架比較

LTX 2.3 常見 GGUF 量化檔案大小比較圖
GGUF 檔案大小不等於最低顯存需求,但能直接看出為什麼 8GB 路線必須依賴卸載與系統記憶體

我的硬體建議很簡單。,GB 顯存可以從 Q4 或經驗證的低顯存工作流開始,系統記憶體最好準備 32GB 以上,12GB 到 16GB 顯存會比較有調整空間。若要使用 BF16、較高解析度、長片段或多階段放大,32GB 以上顯存才接近官方設定,實際速度還會受 GPU 架構、RAM、磁碟、解析度、影格數與節點版本影響。

最省事的安裝方法是官方模板

第一次安裝不要急著手動搬十幾個檔案,先把 ComfyUI 更新到支援 LTX 2.3 的版本,再用模板庫建立一條能正常執行的基準工作流,這和我整理 Ideogram 4 的 ComfyUI 本機部署時採用的思路一樣,先跑通官方基線,再加入量化與自訂節點。

  1. 開啟 ComfyUI Desktop 或現有 ComfyUI
  2. 完成程式與前端更新後重新啟動
  3. 進入 Templates 並切換到 Video
  4. 搜尋 LTX-2.3
  5. 先安裝 Image to Video 與 Text to Video 模板
  6. 按下 Download all 取得必要模型
  7. 重新啟動後先用低解析度與少量影格測試

官方建議先用 480×720 與 41 到 81 個影格確認流程,工作流穩定後,再提高解析度、片長與品質。這一步看起來保守,卻能很快分辨問題來自模型、節點、顯存,還是提示詞。

手動安裝時,模型應該放在哪裡

ComfyUI Desktop、Portable 與自行安裝版的根目錄可能不同,最穩的方法是從 ComfyUI 介面打開模型資料夾,再依下面的相對路徑放置。不要直接照抄別人的 Windows 使用者名稱。

檔案類型建議路徑用途
官方主模型models/checkpoints/LTX-VideoBF16、Distilled 或官方檢查點
社群 GGUFmodels/unet交給 GGUF Loader 載入
文字編碼器models/text_encodersGemma 3 與 LTX 文字投影
視訊與音訊 VAEmodels/vae解碼影像、聲音與預覽
LTX 2.3 LoRAmodels/loras/LTX-2.3Distilled、風格或控制能力

原始權重可從 LTX 2.3 Hugging Face取得。官方推理程式與訓練工具位於 Lightricks LTX-2 GitHub,ComfyUI 節點與範例工作流則在 ComfyUI-LTXVideo

匯入工作流後出現紅色節點怎麼辦

紅色節點通常不是模型壞掉,而是工作流引用了本機尚未安裝的自訂節點。先在錯誤視窗選擇 Install Missing Custom Nodes,完成後按 Apply Changes 並重新啟動,若仍缺少 Fast Groups Bypasser 類節點,可在 Manager 搜尋並安裝 rgthree-comfy

GGUF 權重還需要 ComfyUI-GGUF。安裝後重新啟動,在畫布空白處搜尋 GGUF Loader,把原本模型載入器的輸出改接到工作流的 model 輸入,再重新整理節點並選擇 Q4 或 Q5 檔案。

一個可以直接改寫的繁中提示詞

LTX 2.3 的提示詞不要只寫「讓照片動起來」。把人物動作、對白、聲音、鏡頭、畫質與禁止項目分開,模型比較容易理解時間順序與同步關係。

場景與動作
一名年輕女子站在安靜的室內,先看向鏡頭,再輕輕吸一口氣,以略帶緊張但自然的神情說話。嘴唇清楚說出指定的中文台詞,嘴型與發音準確同步。

聲音
自然的年輕華語女聲,語氣柔和、真實、略帶緊張,像日常交談,不要誇張。保留輕微呼吸聲與安靜室內環境音,不要配樂。

鏡頭
鏡頭緩慢推近臉部,只有很輕微的手持感。淺景深,焦點穩定,自然室內光線。

畫面品質
寫實電影感,皮膚紋理自然,眼神與微表情細膩,髮絲運動合理,動作流暢,人物身份保持一致。

避免項目
不要字幕,不要畫面文字,不要額外人物,不要旁白,不要機械聲,不要誇張表情,不要臉部變形,不要嘴唇變形,不要突然移動鏡頭。

實際使用時,把第一段換成你的角色、場景、動作與台詞即可。先固定一個鏡頭與一個主要動作,再逐步增加人物、轉場與複雜聲場。一次要求太多事件,往往比模型能力不足更容易造成身份漂移。

中文對白可用,但字幕最好留給後製

實測裡最值得記下來的缺點,是中文畫面文字仍可能出現亂碼,即使官方表示文字渲染已改善,這不代表長句中文字幕已經可靠,若提示詞要求中文對白,模型有時還會自行生成錯誤字幕。

  • 提示詞明確加入「不要字幕、不要畫面文字」
  • 先生成乾淨畫面與聲音
  • 輸出後再用剪輯軟體或字幕工具加入繁中字幕
  • 若聲音品質不穩,可把畫面生成與語音生成拆成兩條工作流

需要更細的角色音色控制時,可以搭配Qwen3-TTS 音色設計工作流,讓 LTX 2.3 專注畫面,再由語音模型與後製負責台詞品質,這通常比強迫單一模型同時把中文聲音與中文字都做到完美更務實。

本地還是雲端,差別不只在費用

本地工作流的優點是素材不必上傳第三方、模型與節點可自行調整,而且安裝完成後沒有逐秒 API 費用,缺點是模型檔很大,節點版本容易衝突,還要自己處理顯存與輸出速度。若你比較在意快速試模板與交付,也可以對照RunningHub 的雲端 ComfyUI 工作流,再決定控制權與便利性哪個重要。

解除限制版本不是品質保證

社群常用「無審查」或「解除限制」描述修改版權重。這只代表輸入限制可能不同,不代表畫質、授權、安全性或商用條件比官方版本更好。下載前要確認模型來源、授權條款與檔案雜湊,人物照片與聲音也必須取得同意。

尤其是換臉、移除人物、替換台詞與生成擬真人物時,更要避免冒用身份、未經同意的私密內容與誤導性成品。LTX 官方也有商業授權條件,企業使用前應直接閱讀最新授權,而不是只看模型能不能下載。

下載與參考資源

我的結論

如果目標是直式角色短片、圖生影片、帶環境音的短場景,LTX 2.3 很值得測,若目標是穩定中文字、長篇敘事或大量商業輸出,仍要把字幕、語音、剪輯與品質檢查拆成獨立步驟。模型負責生成,工作流負責把結果變成可以交付的作品。

FAQ

LTX 2.3 真的能在 8GB 顯卡執行嗎

可以,但通常要使用 GGUF 量化權重、CPU offload 與足夠的系統記憶體。8GB 指的是可嘗試的顯存門檻,不代表完整模型全放在 GPU,也不保證固定生成速度。

新手應該選 BF16、FP8 還是 GGUF

先用官方 Distilled 或 FP8 模板確認工作流。顯存不足再改用 GGUF。BF16 適合硬體充足並且重視品質的人,GGUF 適合願意接受卸載、速度與相容性取捨的低顯存使用者。

為什麼匯入工作流後有紅色節點

多半是缺少自訂節點或節點版本太舊。先執行 Install Missing Custom Nodes,再更新 ComfyUI、ComfyUI-LTXVideo、rgthree-comfy 與 ComfyUI-GGUF,完成後重新啟動。

中文對白為什麼會出現亂碼字幕

模型可能把對白理解成需要同步生成的畫面文字,而中文長句仍不穩定。提示詞加入不要字幕與不要畫面文字,先生成乾淨影音,再於後製加入繁中字幕最可靠。

LTX 2.3 可以離線使用嗎

模型、節點與依賴下載完成後可以在本機執行。首次安裝、更新模型或補齊節點仍需要網路,並且要預留足夠磁碟空間。

Amuse 2.0:結合 AMD CPU 和 GPU 的 AI 圖像生成利器

Amuse 2.0:結合 AMD CPU 和 GPU 的 AI 圖像生成利器

AMD於2024年7月推出了Amuse 2.0 Beta版本,這是一款專為AMD平台設計的AI創作工具,替 AMD CPU、GPU的用戶提供更簡便的AI圖像生成體驗。

主要特色:

  • AMD XDNA超分辨率技術:該技術可在圖像生成結束時,將輸出尺寸提高兩倍。例如,將512×512像素的圖像放大至1024×1024像素,提升圖像細節和清晰度。
  • 多樣化的AI功能:Amuse 2.0提供了繪畫和草圖圖像轉換、可自定義AI濾鏡,以及基於ONNX的多階段管線等功能,滿足不同創作需求。
  • 「容易模式」(Ez Mode):即使用戶沒有專業的AI知識,也能透過此模式輕鬆上手,享受AI創作的樂趣。

硬體支援:

Amuse 2.0的推薦配置包括:

  • 配備24GB或以上記憶體的Ryzen AI 300系列處理器。
  • 配備32GB記憶體的Ryzen 8040系列處理器(需更新至最新的OEM MCDM和NPU驅動)。
  • Radeon RX 7000系列顯示卡。

目前只有Ryzen AI 300系列和更新驅動後的Ryzen 8000系列處理器支援AMD XDNA超分辨率技術。

安裝與使用:

到官網去下載 Amuse 2.0為單一可執行(EXE)檔案,無需額外的相依性,安裝過程簡單。首次啟動時,系統會自動偵測硬體配置,並自動設定最佳化參數。建議初次使用者選擇「平衡」設定,以在性能和品質之間取得良好平衡。

Tensor.art 綜述:AI 驅動的免費圖像生成平台

Tensor.art 綜述:AI 驅動的免費圖像生成平台

Tensor.art 是一個 AI 的免費線上圖像生成平台,用穩定擴散模型(SD, Stable Diffusion)來生成圖片,用戶可以透過選擇不同的檢查點(模型)和細節調整元素(LURAs)來生成圖像,這些工具允許用戶調整生成圖像的細節和風格,Tensor.art 每天都提供用戶一定數量的免費信用額,一般使用者已經很夠用

技術方面

Tensor.art 提供多種圖像生成選項,包括基於文本的圖像生成和圖像到圖像的轉換。用戶可以通過上傳參考圖像和相應的文本提示來精確控制生成的圖像類型和風格​。此外,平台還支持使用控制網格(Control Net)進一步細調圖像的外觀,以及高解析度修正工具來解決非標準長寬比圖像生成時可能出現的問題​。

Tensor.art 的界面友善,適合各種經驗水平的用戶。新手可以利用預設的模型和設置快速開始,而經驗豐富的創作者則可以探索更多高級功能,如自定義種子、詳細程度調整和不同的取樣方法,這些功能提供了豐富的視覺特性和個性化選項​。

參考資料

探索Getimg.ai:創建商業級圖像和個性化AI模型

探索Getimg.ai:創建商業級圖像和個性化AI模型

在當今數位化世界中,人工智慧(AI)技術正日益成為藝術和設計領域的一個重要驅動力。

其中一個引人矚目的工具就是Getimg.ai,這是一個提供多種圖像生成和修改功能的平台。

在本文中,我們將深入探討Getimg.ai的核心功能和用例,以及如何開始使用這個令人驚嘆的工具,同時回答一些常見的問題。

Getimg.ai的核心功能

1. 用圖生圖

Getimg.ai的一個令人印象深刻的功能是,它允許您使用圖像生成更多圖像。這意味著您可以將現有圖像作為基礎,快速生成相似或有趣的變體,無需繼續訓練模型。

2. 無需練模,使用SD

相對於需要冗長的模型訓練過程,Getimg.ai讓您無需練模,即刻使用。這省去了大量時間和資源,讓您可以專注於創作,而不是等待模型訓練完成。

3. 融合Leonardo功能

Leonardo是Getimg.ai的一個強大元素,它提供了更多創作選項。您可以融合Leonardo的功能,使您的圖像生成更具藝術性和創意。

4. 輕鬆用ControlNet控制圖片

Getimg.ai引入了ControlNet,這讓您能夠更精確地控制圖片的生成過程。無論您是調整色彩、樣式還是其他參數,ControlNet使您可以實現完全個性化的圖像生成。

Getimg.ai的用例

  • 藝術創作: 藝術家可以利用Getimg.ai來快速生成藝術品的變體,並探索新的創作方向。
  • 設計項目: 設計師可以使用Getimg.ai來生成設計項目所需的圖像,節省時間並提高效率。
  • 動畫製作: 動畫製作者可以使用Getimg.ai生成動畫素材,增添動畫項目的視覺吸引力。
  • 建築概念: 建築師可以利用Getimg.ai創建建築概念圖,幫助客戶更好地理解他們的項目。
  • 商業項目: 您可以將Getimg.ai生成的圖像用於商業項目,但請牢記CreativeML Open RAIL-M許可證的適用性。

常見問題

– 我可以將生成的圖像用於商業項目嗎?

是的,您可以商業用途使用生成的圖像。但請注意,CreativeML Open RAIL-M許可證適用於創建的圖像。

– 如何生成美麗的圖像?

大多數情況下,簡單的提示可能不足以獲得優秀的結果。但是,寫出好的提示是可以學習的。您可以開始閱讀OpenArt提示手冊,以瞭解如何編寫有效的提示。

– Getimg.ai真的免費嗎?

是的,它是免費的。您每個月可以免費生成100張圖像,只需創建一個帳戶。此外,您還可以通過引薦朋友和追隨者來獲得更多的積分。

延伸閱讀

AIGC 打破初學者障礙:專業攝影技巧解析

AIGC 打破初學者障礙:專業攝影技巧解析

想像一下你站在廣闊的海岸邊,眼前是無盡的海洋,手中只有基礎的裝備和對攝影的憧憬。作為攝影小白,這片大海是你的開始。但在 Stable Diffusion 的領航下,這片海洋將成為你的遊樂場,你將學會如何巧妙地駕馭它,使其成為你創作的源泉。

首先,每位航海者都必須確保他的基本技能。與其說是從一個小小的池塘開始,不如說是從海洋的深處 ,一個真正的 masterpiece — 開始。在這片廣大的航道上,有無數的工具(詠唱魔法)和技巧等待你去探索和利用。

攝影作品

比如masterpiece, photography, masterpiece, best quality, 8K和HDR技術。

兼顧品質

透過 highestabsurdres:的技巧,你可以確保每一張照片都如同深海中的珍珠,閃閃發光、獨一無二。

美好的底片技術

當然,這片航道上也有古老的傳說。很多前輩航海者都還記得 Kodak portra 400 膠片的年代。那種 film grain 的質感就像古老的航海圖,充滿了神秘和冒險的味道。雖然我們現在大多數使用數位技術,但那種質感和感覺是我們可以從中學習和模仿的。

成為大師要會的模糊、散景和光暈

在這片偉大的航道上,你將學會如何捕捉那完美的 blurry backgroundbokehlens flare。這些都像是海上的燈塔,指引著你,使你的作品從海洋中脫穎而出。

讓顏色豐富

顏色在這片航道上也扮演著極其重要的角色。學會如何運用和強調 vibrant color:你的照片將如同繽紛的珊瑚礁,吸引眾多的目光。

提詞

正向提詞: photography, masterpiece, best quality, 8K, HDR, highres, absurdres:1.2, Kodak portra 400, film grain, blurry background, bokeh:1.2, lens flare, (vibrant color:1.2)

反面提詞: nsfw, paintings, sketches, (worst quality:2), (low quality:2), (normal quality:2), lowres

提詞參考網站

https://prompthero.com/

同場加映

Stable Diffusion 核心套件更新整理

Stable Diffusion 核心套件更新整理

Stable Diffusion 最近太火紅,是好處也是壞處,好處是更新的速度超快,也代表進步的超快,壞處是每次更新,都需要工程師介入居多,複雜的設定,難懂的語言(只有工程師能懂),都阻礙著更新的進步,這邊用白話文分享如何更新關鍵資源

torch 1.13.1 -> torch 2.0.0

當你跑 run.bat 的時候會出現以下訊息,告訴你應該要申請 torch 了,升級的方法是在執行 webui.bat 的時候,加入 –reinstall-torch,觸發程式去更新 torch

也可以在 lauch.py 中修改 COMMANDLINE_ARGS 加入 –reinstall-torch

@echo off

set PYTHON=
set GIT=
set VENV_DIR=
set COMMANDLINE_ARGS=--reinstall-torch

call webui.bat

重新執行 run.bat 後就會看到開始更新了

更新 xformers

更新 xformers 與更新 torch 類似

我們一樣修改 COMMANDLINE_ARGS 加入 –reinstall-xformers ,然後重新執行 run.bat ,就會啟動更新程序

@echo off

set PYTHON=
set GIT=
set VENV_DIR=
set COMMANDLINE_ARGS=--reinstall-xformers

call webui.bat

更新後的錯誤處理方法

若是更新後啟動失敗,通常是沒 Torch 無法使用 GPU ,那就要加入指令 COMMANDLINE_ARGS=–skip-torch-cuda-test

@echo off

set PYTHON=
set GIT=
set VENV_DIR=
set COMMANDLINE_ARGS=--skip-torch-cuda-test

call webui.bat

AI-繪圖總整理-StableDiffusion – 雨 (rain.tips)