AI Girlfriend V2 把語音對話、長期記憶、聲音克隆與數位人口型整合成 Windows 桌面體驗。
你可以先用純語音聊天,再加上角色影像,它最有意思的地方,是把「聽你說話、延續聊天、用指定聲音回答」接在一起,並讓你管理角色記住的內容。
先釐清兩件事,本機啟動不等於完全離線,目前對話模型使用外部 API,8GB 顯示記憶體也不等於數位人一定流暢,純語音與口型生成有不同負載。
內容目錄
AI Girlfriend V2 是什麼?先分清楚三種工具
AI Girlfriend V2 專案是一套語音陪伴整合系統,AIFISHER則是串接圖片、影片、音訊與模型的創作畫布。
作者提供的 RunningHub 體驗頁,實際名稱是「infinitetalk 單人」,發布者為 Aiwood 愛屋研究室,屬於雲端數位人影片工作流。
- AI Girlfriend V2:負責聊天、語音、記憶與可選的人物回話畫面。
- RunningHub 工作流:用來生成或準備人物影片素材,並非完整陪伴 App。
- AIFISHER 畫布:整理素材、模型呼叫與工作流,也可連接本機 ComfyUI。
如果你已經做過 ComfyUI 動態桌布,這次多出的是即時對話與記憶,循環影片的台詞事先決定,語音陪伴系統則會根據當下輸入組織回答。
從麥克風到角色開口,中間發生什麼事
整條流程可以理解成:麥克風收音 → Silero VAD 判斷發言段落 → Whisper 辨識文字 → DSH Bridge 整理會話與記憶 → 外部語言模型回答 → OmniVoice 合成聲音。開啟數位人後,再把音訊交給 WSL2 裡的 Duix/HeyGem 產生口型。
語音辨識、聲音克隆、語意索引與口型預設在本機處理,對話文字送到你配置的模型服務。
若想看懂各層分工,可延伸讀 本地 speech-to-speech 語音 Agent 流程。這也說明為什麼畫面能動,仍可能沒有聲音或回答。
角色訪談:從自我介紹到連續追問
角色先介紹自己的背景,接著回答興趣、其他喜好與感情狀態,再用同一個人設結束對話。
這種短訪談適合觀察回答是否接續前文、口氣是否一致,以及聲音和嘴型能否配合。角色背景是設定內容,不能當作真實人物經歷。
自己驗收時,可以保留相同問題連問幾輪,再故意改變問法。
先核對辨識文字,再看角色有沒有答非所問或把新問題套回固定台詞。外觀自然與理解正確應分開評估。
純語音與數位人,回覆方式也不同
依 專案案例文件,數位人模式採短回答,避免口型任務過長。
純語音可以給較完整的內容,再分段合成與播放,目前這條路徑仍先等待語言模型完成回答,再分段送出,不是模型每產生一個字就立即開口。
「即時語音」適合理解為可來回互動,體感仍包含停頓判斷、辨識、文字生成與語音處理。加入口型還會多一段等待。
驗收時,從你說完到真正聽見回答開始計時,才能比較設定調整是否有幫助。
8GB 顯卡能跑嗎?兩種模式分開看
以下依 Windows 安裝文件整理。這是專案建議,本文未在指定顯卡上重跑測試。兩種模式都面向 Windows 10/11 64 位元,並需要自行準備外部 LLM API Key。
| 項目 | 純語音 | 數位人口型 |
|---|---|---|
| NVIDIA 顯示記憶體 | 建議 8GB 以上 | 建議 12GB,8GB 可嘗試 |
| 剩餘磁碟空間 | 約 20GB | 建議 35GB 以上 |
| WSL2/CPU 虛擬化 | 不需要 | 需要 |
| 外部 LLM API Key | 需要 | 需要 |

RTX 30 系列不能只用世代判斷是否適用,同系列也有不同容量,還要看驅動、其他程式佔用與實際工作模式,磁碟則要預留解壓、模型與後續輸出空間,不能只按壓縮包大小計算。
安裝前,先確認拿到的是整合包
GitHub 倉庫提供程式碼與文件,不附完整 Python 執行環境、模型、WSL 映像與 DSH 執行元件。
模型與資源文件也明確說明,目前程式碼倉庫不是能獨立從零啟動的一鍵包,下載幾套模型仍不夠。
作者提供的 AI Girlfriend 整合包下載入口與 GitHub 用途不同。
取得包後先核對版本及檔案是否齊全,再按相同版本的安裝文件操作。本文沒有下載或執行網盤整合包,也沒有驗證其完整性。
第一步:先讓純語音聊天成功
- 完整解壓到英文、無空格路徑,例如 D:\AI-Girlfriend。
- 依包內文件執行「一键启动.cmd」,沒有數位人環境時會使用純語音模式。
- 在「設定 → 語言模型」選擇 GLM、Kimi、DeepSeek,或配置支援的相容服務,填入自己的 API Key。
- 允許瀏覽器使用麥克風,先用預設音色測試一段簡單對話。
第一次先不要同時換角色、聲音、人設與模型,先確認辨識文字是否正確、回覆是否答到問題,以及聲音能否完整播放。這三件事過關後,再逐項增加設定。
第二步:需要人物畫面,再啟用 WSL2
數位人口型需要 WSL2 與 CPU 虛擬化,完整包的「首次安装.cmd」會檢查環境並匯入引擎,尚未啟用 WSL2 時可能出現管理員授權與重新啟動要求,依提示完成重啟後,再次執行安裝,等引擎就緒才回到日常啟動流程。
有聲音但沒有人物畫面時,可先關閉數位人繼續聊天,再查 WSL2 與口型服務。網頁、語音、記憶及口型是不同服務,不能靠反覆重整網頁修復缺失的引擎或模型。
角色影像、待機影像與聲音,應該怎麼準備
角色影像是後續口型生成的素材,待機影像則負責等待時的自然動態,先選同一位角色、相近構圖與光線,嘴部保持清楚,避免手或物件遮擋,才容易在等待與說話畫面間切換。
人物素材可先用 AIFISHER 產生參考圖,再到 RunningHub 準備影片,公開的 InfiniteTalk 工作流頁列出圖像載入、音訊載入與 WanVideo 等節點,使用時應按實際工作流要求提供素材。雲端先生成底片,可以減少為了少量素材另建一套本機影片生成環境的時間。
不過,素材在雲端生成與聊天時在本機合成口型,是兩個階段,完成底片不代表對話系統已建立,RunningHub 的排隊、執行費用與可用條件也需另行確認,本次沒有執行付費工作流。
安裝文件建議使用短而清楚的正面影片,以及乾淨的單人參考錄音,聲音克隆還需準備與錄音一致的文字,雜音、背景音樂或錯誤逐字內容,都會增加後續辨識與合成的不確定性,人物與聲音先使用自己製作或有授權的素材。
如果想自己拆開人物服務與聊天模型,可參考 Qwen3 與 LiveTalking 的語音數位人串接方式,那是另一組元件配置,不能把腳本或模型直接當成 AI Girlfriend V2 的替換品。
人設先寫回覆規則,再補背景
角色介紹可以有興趣與說話習慣,但日常體驗更受回覆長度、追問節奏與事實一致性影響
以下是本文設計的起步示例,可依需求調整,並非專案預設提示詞。
你是一位名叫小晴的虛擬聊天夥伴,使用自然的台灣繁體中文口語。先回應我剛說的內容,每次說一兩個重點,再視需要提出一個簡單問題。不確定的事直接說不確定,不要虛構我沒有說過的經歷。需要記住偏好時,保留原話的意思。
長期記憶有什麼用?也要能修正
AI Girlfriend V2 使用 DSH 會話檢查點、SQLite 事實庫與語意索引保存脈絡。
檢查點幫助延續完整對話,事實庫保存稱呼等資訊,語意檢索則讓你換一種問法找回舊話題。
它不等於每次把所有歷史逐字塞進模型,也不保證永遠記得所有細節。
可以先用一段虛構資料驗收:告訴角色一個稱呼,重新啟動後再問一次。
接著用不同說法詢問先前偏好,最後在記憶面板更正資料,檢查新答案是否採用更正結果。專案文件把這些列為合成案例,不能直接視為所有真實對話都已驗證。
「移出記憶」會從長期事實與檢索中抑制內容,但原始 DSH 會話檔案仍可能保留。
它的效果不同於把所有歷史物理刪除。關係進度也只是依聊天規則累積的介面回饋,適合當作互動設計理解。
AIFISHER 畫布怎麼搭配使用
AIFISHER 把圖片、影片、音訊與文字放在同一個創作空間,讓你整理參考素材、呼叫模型與保存結果。製作桌面角色時,可以先固定一張形象,再整理待機與說話影片,避免素材散落在不同資料夾。
目前 官方 README提供本機 ComfyUI、RunningHub 與模型服務接入。
來源工作流匯入後,仍需確認要暴露哪些輸入參數,再保存成畫布中的流程,不能只看節點已載入就判定模型與服務都能執行。
下載可由 版本發布頁或 目前 README 的安裝版入口確認。
本機保存、外部 API 與使用授權
依 AI Girlfriend V2 安全說明,本機服務預設只監聽 127.0.0.1,模型收到的對話文字仍會傳給配置的外部供應商,API Key、對話紀錄、聲音與人物影片是不同資料,備份或分享整合目錄前要分開檢查。
AIFISHER 的專案與素材預設存在本機,但呼叫線上生成會傳出相關提示詞與參考素材,官方服務也可能接收裝置識別與呼叫診斷。因此,「本地畫布」也不能直接推論為完全不連網或資料永不離開電腦。
使用範圍請分別看文件,AI Girlfriend V2 沒有宣告整個倉庫都使用同一授權,第三方元件說明列出的 OmniVoice 預訓練權重有非商業限制,AIFISHER 授權則明確限制非商業用途,並禁止接單、商業製作與倒賣,不能把公開程式碼視為可自由商用。
第一次體驗,我會先確認這幾件事
- 用預設角色與音色,把收音、辨識、回答和播放跑通。
- 用虛構資料測試跨重啟記憶與人工更正。
- 加入短人物影片,確認等待時間、口型與音訊是否可接受。
- 再逐項調整人設、音色與角色素材,保留可以退回的設定。
這套系統的價值在於把多個元件包成可使用的桌面流程,並把記憶管理交回使用者。先讓一段對話穩定完成,比一開始追求高畫質、複雜人設與更大模型更容易得到可長期使用的結果。
常見問題
AI Girlfriend V2 可以完全離線聊天嗎?
目前專案配置的對話 LLM 使用外部 API,語音辨識、聲音克隆與口型等在本機處理。本機啟動不等於整套系統完全離線。
8GB 顯示記憶體可以使用嗎?
安裝文件對純語音建議 8GB 以上,數位人建議 12GB,8GB 可嘗試。實際流暢度仍受顯卡、其他程式與工作模式影響。
從 GitHub 下載程式碼,就能一鍵啟動嗎?
不能。倉庫沒有完整執行環境、模型與數位人映像,初次體驗應確認取得相同版本且檔案齊全的 Windows 整合包。
RunningHub 那個頁面是完整 AI 女友嗎?
該頁是 infinitetalk 單人影片工作流,用來生成數位人素材。即時聊天、語音與記憶仍由另外的桌面系統處理。
AIFISHER 能用來做商業接單嗎?
目前 AIFISHER 授權限制非商業用途,並禁止接單與商業製作。其他元件、模型與素材也需分別核對使用範圍。
近期留言