Select Page

AI Girlfriend V2 把語音對話、長期記憶、聲音克隆與數位人口型整合成 Windows 桌面體驗。

你可以先用純語音聊天,再加上角色影像,它最有意思的地方,是把「聽你說話、延續聊天、用指定聲音回答」接在一起,並讓你管理角色記住的內容。

先釐清兩件事,本機啟動不等於完全離線,目前對話模型使用外部 API,8GB 顯示記憶體也不等於數位人一定流暢,純語音與口型生成有不同負載。

AI Girlfriend V2 是什麼?先分清楚三種工具

AI Girlfriend V2 專案是一套語音陪伴整合系統,AIFISHER則是串接圖片、影片、音訊與模型的創作畫布。

作者提供的 RunningHub 體驗頁,實際名稱是「infinitetalk 單人」,發布者為 Aiwood 愛屋研究室,屬於雲端數位人影片工作流。

  • AI Girlfriend V2:負責聊天、語音、記憶與可選的人物回話畫面。
  • RunningHub 工作流:用來生成或準備人物影片素材,並非完整陪伴 App。
  • AIFISHER 畫布:整理素材、模型呼叫與工作流,也可連接本機 ComfyUI。

如果你已經做過 ComfyUI 動態桌布,這次多出的是即時對話與記憶,循環影片的台詞事先決定,語音陪伴系統則會根據當下輸入組織回答。

從麥克風到角色開口,中間發生什麼事

整條流程可以理解成:麥克風收音 → Silero VAD 判斷發言段落 → Whisper 辨識文字 → DSH Bridge 整理會話與記憶 → 外部語言模型回答 → OmniVoice 合成聲音。開啟數位人後,再把音訊交給 WSL2 裡的 Duix/HeyGem 產生口型。

語音辨識、聲音克隆、語意索引與口型預設在本機處理,對話文字送到你配置的模型服務。

若想看懂各層分工,可延伸讀 本地 speech-to-speech 語音 Agent 流程。這也說明為什麼畫面能動,仍可能沒有聲音或回答。

角色訪談:從自我介紹到連續追問

角色先介紹自己的背景,接著回答興趣、其他喜好與感情狀態,再用同一個人設結束對話。

這種短訪談適合觀察回答是否接續前文、口氣是否一致,以及聲音和嘴型能否配合。角色背景是設定內容,不能當作真實人物經歷。

自己驗收時,可以保留相同問題連問幾輪,再故意改變問法。

先核對辨識文字,再看角色有沒有答非所問或把新問題套回固定台詞。外觀自然與理解正確應分開評估。

純語音與數位人,回覆方式也不同

依 專案案例文件,數位人模式採短回答,避免口型任務過長。

純語音可以給較完整的內容,再分段合成與播放,目前這條路徑仍先等待語言模型完成回答,再分段送出,不是模型每產生一個字就立即開口。

「即時語音」適合理解為可來回互動,體感仍包含停頓判斷、辨識、文字生成與語音處理。加入口型還會多一段等待。

驗收時,從你說完到真正聽見回答開始計時,才能比較設定調整是否有幫助。

8GB 顯卡能跑嗎?兩種模式分開看

以下依 Windows 安裝文件整理。這是專案建議,本文未在指定顯卡上重跑測試。兩種模式都面向 Windows 10/11 64 位元,並需要自行準備外部 LLM API Key。

項目純語音數位人口型
NVIDIA 顯示記憶體建議 8GB 以上建議 12GB,8GB 可嘗試
剩餘磁碟空間約 20GB建議 35GB 以上
WSL2/CPU 虛擬化不需要需要
外部 LLM API Key需要需要
AI Girlfriend V2 純語音與數位人口型的顯示記憶體、磁碟空間、WSL2 與 API 條件比較
依專案安裝文件整理,核對日期為 2026 年 10 月 5 日。8GB 可嘗試不代表每張顯卡都能流暢運作。

RTX 30 系列不能只用世代判斷是否適用,同系列也有不同容量,還要看驅動、其他程式佔用與實際工作模式,磁碟則要預留解壓、模型與後續輸出空間,不能只按壓縮包大小計算。

安裝前,先確認拿到的是整合包

GitHub 倉庫提供程式碼與文件,不附完整 Python 執行環境、模型、WSL 映像與 DSH 執行元件。

模型與資源文件也明確說明,目前程式碼倉庫不是能獨立從零啟動的一鍵包,下載幾套模型仍不夠。

作者提供的 AI Girlfriend 整合包下載入口與 GitHub 用途不同。

取得包後先核對版本及檔案是否齊全,再按相同版本的安裝文件操作。本文沒有下載或執行網盤整合包,也沒有驗證其完整性。

第一步:先讓純語音聊天成功

  • 完整解壓到英文、無空格路徑,例如 D:\AI-Girlfriend。
  • 依包內文件執行「一键启动.cmd」,沒有數位人環境時會使用純語音模式。
  • 在「設定 → 語言模型」選擇 GLM、Kimi、DeepSeek,或配置支援的相容服務,填入自己的 API Key。
  • 允許瀏覽器使用麥克風,先用預設音色測試一段簡單對話。

第一次先不要同時換角色、聲音、人設與模型,先確認辨識文字是否正確、回覆是否答到問題,以及聲音能否完整播放。這三件事過關後,再逐項增加設定。

第二步:需要人物畫面,再啟用 WSL2

數位人口型需要 WSL2 與 CPU 虛擬化,完整包的「首次安装.cmd」會檢查環境並匯入引擎,尚未啟用 WSL2 時可能出現管理員授權與重新啟動要求,依提示完成重啟後,再次執行安裝,等引擎就緒才回到日常啟動流程。

有聲音但沒有人物畫面時,可先關閉數位人繼續聊天,再查 WSL2 與口型服務。網頁、語音、記憶及口型是不同服務,不能靠反覆重整網頁修復缺失的引擎或模型。

角色影像、待機影像與聲音,應該怎麼準備

角色影像是後續口型生成的素材,待機影像則負責等待時的自然動態,先選同一位角色、相近構圖與光線,嘴部保持清楚,避免手或物件遮擋,才容易在等待與說話畫面間切換。

人物素材可先用 AIFISHER 產生參考圖,再到 RunningHub 準備影片,公開的 InfiniteTalk 工作流頁列出圖像載入、音訊載入與 WanVideo 等節點,使用時應按實際工作流要求提供素材。雲端先生成底片,可以減少為了少量素材另建一套本機影片生成環境的時間。

不過,素材在雲端生成與聊天時在本機合成口型,是兩個階段,完成底片不代表對話系統已建立,RunningHub 的排隊、執行費用與可用條件也需另行確認,本次沒有執行付費工作流。

安裝文件建議使用短而清楚的正面影片,以及乾淨的單人參考錄音,聲音克隆還需準備與錄音一致的文字,雜音、背景音樂或錯誤逐字內容,都會增加後續辨識與合成的不確定性,人物與聲音先使用自己製作或有授權的素材。

如果想自己拆開人物服務與聊天模型,可參考 Qwen3 與 LiveTalking 的語音數位人串接方式,那是另一組元件配置,不能把腳本或模型直接當成 AI Girlfriend V2 的替換品。

人設先寫回覆規則,再補背景

角色介紹可以有興趣與說話習慣,但日常體驗更受回覆長度、追問節奏與事實一致性影響

以下是本文設計的起步示例,可依需求調整,並非專案預設提示詞。

你是一位名叫小晴的虛擬聊天夥伴,使用自然的台灣繁體中文口語。先回應我剛說的內容,每次說一兩個重點,再視需要提出一個簡單問題。不確定的事直接說不確定,不要虛構我沒有說過的經歷。需要記住偏好時,保留原話的意思。

長期記憶有什麼用?也要能修正

AI Girlfriend V2 使用 DSH 會話檢查點、SQLite 事實庫與語意索引保存脈絡。

檢查點幫助延續完整對話,事實庫保存稱呼等資訊,語意檢索則讓你換一種問法找回舊話題。

它不等於每次把所有歷史逐字塞進模型,也不保證永遠記得所有細節。

可以先用一段虛構資料驗收:告訴角色一個稱呼,重新啟動後再問一次。

接著用不同說法詢問先前偏好,最後在記憶面板更正資料,檢查新答案是否採用更正結果。專案文件把這些列為合成案例,不能直接視為所有真實對話都已驗證。

「移出記憶」會從長期事實與檢索中抑制內容,但原始 DSH 會話檔案仍可能保留。

它的效果不同於把所有歷史物理刪除。關係進度也只是依聊天規則累積的介面回饋,適合當作互動設計理解。

AIFISHER 畫布怎麼搭配使用

AIFISHER 把圖片、影片、音訊與文字放在同一個創作空間,讓你整理參考素材、呼叫模型與保存結果。製作桌面角色時,可以先固定一張形象,再整理待機與說話影片,避免素材散落在不同資料夾。

目前 官方 README提供本機 ComfyUI、RunningHub 與模型服務接入。

來源工作流匯入後,仍需確認要暴露哪些輸入參數,再保存成畫布中的流程,不能只看節點已載入就判定模型與服務都能執行。

下載可由 版本發布頁或 目前 README 的安裝版入口確認。

本機保存、外部 API 與使用授權

依 AI Girlfriend V2 安全說明,本機服務預設只監聽 127.0.0.1,模型收到的對話文字仍會傳給配置的外部供應商,API Key、對話紀錄、聲音與人物影片是不同資料,備份或分享整合目錄前要分開檢查。

AIFISHER 的專案與素材預設存在本機,但呼叫線上生成會傳出相關提示詞與參考素材,官方服務也可能接收裝置識別與呼叫診斷。因此,「本地畫布」也不能直接推論為完全不連網或資料永不離開電腦。

使用範圍請分別看文件,AI Girlfriend V2 沒有宣告整個倉庫都使用同一授權,第三方元件說明列出的 OmniVoice 預訓練權重有非商業限制,AIFISHER 授權則明確限制非商業用途,並禁止接單、商業製作與倒賣,不能把公開程式碼視為可自由商用。

第一次體驗,我會先確認這幾件事

  • 用預設角色與音色,把收音、辨識、回答和播放跑通。
  • 用虛構資料測試跨重啟記憶與人工更正。
  • 加入短人物影片,確認等待時間、口型與音訊是否可接受。
  • 再逐項調整人設、音色與角色素材,保留可以退回的設定。

這套系統的價值在於把多個元件包成可使用的桌面流程,並把記憶管理交回使用者。先讓一段對話穩定完成,比一開始追求高畫質、複雜人設與更大模型更容易得到可長期使用的結果。

常見問題

AI Girlfriend V2 可以完全離線聊天嗎?

目前專案配置的對話 LLM 使用外部 API,語音辨識、聲音克隆與口型等在本機處理。本機啟動不等於整套系統完全離線。

8GB 顯示記憶體可以使用嗎?

安裝文件對純語音建議 8GB 以上,數位人建議 12GB,8GB 可嘗試。實際流暢度仍受顯卡、其他程式與工作模式影響。

從 GitHub 下載程式碼,就能一鍵啟動嗎?

不能。倉庫沒有完整執行環境、模型與數位人映像,初次體驗應確認取得相同版本且檔案齊全的 Windows 整合包。

RunningHub 那個頁面是完整 AI 女友嗎?

該頁是 infinitetalk 單人影片工作流,用來生成數位人素材。即時聊天、語音與記憶仍由另外的桌面系統處理。

AIFISHER 能用來做商業接單嗎?

目前 AIFISHER 授權限制非商業用途,並禁止接單與商業製作。其他元件、模型與素材也需分別核對使用範圍。