by Rain Chu | 7 月 14, 2026 | AI , 語音分離 , 語音合成 , 語音辨識 , 音樂
以前想在本機跑語音模型,常常是一個 TTS 一套環境,一個 ASR 一套環境,AI 翻唱又是另一套 CUDA 和 Python 依賴。最後不是模型不夠好,而是環境先把人勸退。
audio.cpp-webui 想解決的正是這件事。它把 TTS、ASR、聲音克隆、即時語音、音樂生成、音色遷移和聲音設計放到同一個 WebUI 裡,背後用本地模型服務統一調度。你可以把它理解成語音領域的 llama.cpp 或 Ollama。文字大模型有本地推理中心,語音模型也開始有自己的本地運行中心。
audio.cpp 解決的是語音模型碎片化
本地語音 AI 的痛點一直很明顯。TTS 要裝一套,ASR 要裝一套,聲音轉換要裝一套,音樂生成又要裝一套。每套工具都有自己的版本要求、模型格式、顯存需求和啟動方式。audio.cpp 把這些能力接到同一個後台,讓使用者透過同一套界面切換模型。
這件事的意義很像我之前整理過的 本地大模型推理框架比較 。當底座統一之後,真正省下來的不是某一次安裝時間,而是後續每次換模型、接應用、做工作流時的摩擦成本。
TTS 和聲音克隆是最容易上手的入口
audio.cpp-webui 的 TTS 介面可以選模型、載入參考音訊、輸入文字,再生成語音。整合包裡常見的入口包含 Pocket TTS 和 Qwen3-TTS 0.6B。Pocket TTS 偏英文,中文語音更適合用 Qwen3-TTS 這類模型。
Qwen3-TTS 的優點是參數不大,中文效果也不錯。若你想先理解它的能力,我之前整理過一篇 Qwen3-TTS 與音色設計 ,可以一起看。audio.cpp 的價值在於,它不是只支援某一個模型,而是讓多個 TTS 模型都能被放進同一個語音服務裡。
參考音訊不建議太長,控制在 10 秒以內比較實際。太長會拖慢合成速度,也不一定帶來更好的克隆效果。常用音色可以放到 WebUI 指定目錄,再把檔名與對應文字整理好,後續就不用每次手動上傳。
ASR 讓語音輸入變成可接入的文字層
ASR 是 audio.cpp 另一個關鍵能力。Qwen3-ASR 這類模型可以把麥克風或音訊檔轉成文字,中英文都能處理。單人語音轉寫比較穩,多人對話則可以使用對話模式,把不同說話人分段標出來。
這對本地 Agent 很重要。因為語音互動其實可以拆成三層:麥克風輸入交給 ASR,大語言模型負責理解與回答,最後再用 TTS 朗讀。audio.cpp 負責的是聽和說這一層,大模型可以是本地 Ollama,也可以是雲端 API。
如果你正在做語音 Agent,可以對照我之前寫的 Hugging Face speech-to-speech 本地即時語音 Agent 。兩者關心的都是同一件事:把語音輸入、模型推理和語音輸出串成一條穩定的互動管線。
即時語音系統的架構
audio.cpp 的即時語音流程很直覺。使用者說話,ASR 把聲音轉成文字,LLM 生成回答,TTS 再把回答唸出來。整套流程可以把語音層放在本機,讓資料不必全部送到雲端語音平台。
步驟 負責元件 作用 語音輸入 麥克風 接收使用者說話 語音轉文字 ASR 模型 把聲音轉成文字 prompt 回答生成 LLM 本地或雲端大模型產生回答 文字轉語音 TTS 模型 把回答轉成聲音 應用接入 OpenAI 相容接口 讓其他應用呼叫本地 TTS 或 ASR
這個架構的彈性在於 LLM 那一層可以替換。你可以接雲端 API,也可以接本地 Ollama。若你想把語音服務接到不同電腦或區網環境,我之前的 Ollama 遠端連線教學 也能作為網路配置的參考。
AI 翻唱和音樂生成也被放進同一個底座
audio.cpp 不只整合 TTS 和 ASR,也把 ACE-Step、Stable Audio、聲音轉換、歌聲轉換等音樂能力放進同一個工具裡。這讓它不只是語音助手工具,也能處理 AI 翻唱、換詞翻唱和背景音樂生成。
換詞翻唱的流程大致是先上傳原曲,讓模型分析歌曲風格與曲譜資訊,再填入原曲歌詞和新歌詞。若新詞唱不準,可以調 Flow Edit 參數,常見測試區間是 0.7 到 0.9。若只是要背景音樂,Stable Audio 會比 ACE-Step 更穩一些。
音色遷移則是保持內容和語氣,把聲音換成另一種音色。若追求歌聲轉換品質,RVC 流程仍然更值得保留。audio.cpp 的優勢在於統一入口,而不是每個單項都一定超過專門工具。
8G 顯存能跑,但要理解限制
這次最有吸引力的點,是多數核心功能可以在 8G 顯存的消費級顯卡上跑起來。像 Qwen3-TTS、Qwen3-ASR、部分 TTS 和 ASR 模型,對顯存要求相對友善。VibeVoice 合成長文本時,顯存也能控制在 7G 左右。
但這不代表所有模型都能在低配機器上順跑。音樂生成、翻唱、聲音轉換通常更吃資源。A 卡和沒有獨顯的機器可以走 CPU 模式,但速度會慢,適合測輕量模型,不適合期待即時體驗。
NVIDIA 16 系到 50 系顯卡比較適合整合包體驗
8G 顯存可以跑多數 TTS、ASR 和部分音樂模型
CPU 模式能跑部分輕量模型,但延遲會增加
參考音訊越長,TTS 合成速度越容易被拖慢
AI 翻唱隨機性較高,需要多試幾次參數
下載和使用要注意什麼
audio.cpp 本體是 C++ 專案,源碼在 audio.cpp-webui GitHub 。對熟悉命令列的人來說,可以直接從源碼開始。若只想快速體驗,整合包會比較省事。
我的使用判斷
audio.cpp-webui 最適合兩種人。第一種是想在本機跑語音模型的創作者,例如要做配音、聲音克隆、語音轉文字、AI 翻唱。第二種是開發者,想替自己的本地 Agent 或應用加上語音輸入輸出。
如果你只需要單一 TTS,直接用專門工具可能更快。如果你想把 TTS、ASR、語音助手、聲音轉換和音樂生成放進同一套本地服務,那 audio.cpp 的價值就出來了。它把語音模型從「一堆分散工具」往「一個本地語音底座」推了一步。
我會把它看成語音 AI 版的本地推理中心。文字模型有 Ollama,圖片影片有 ComfyUI,語音模型也需要這樣的入口。audio.cpp 還在快速發展,但方向是對的。只要模型支援越來越多,接口越來越穩,本地語音 Agent 的門檻會明顯下降。
FAQ
audio.cpp 是什麼?
audio.cpp 是本地音訊模型底座,目標是把 TTS、ASR、聲音轉換、音樂生成和即時語音整合到同一套本地服務裡。
audio.cpp-webui 適合誰?
適合想在本機跑聲音克隆、語音轉文字、即時語音助手、AI 翻唱或本地 Agent 語音輸入輸出的人。
8G 顯存真的能跑嗎?
多數 TTS、ASR 與部分音樂功能可以在 8G 顯存上跑起來。部分輕量模型甚至能用 CPU,只是速度會慢一些。
它和 Ollama 或 llama.cpp 有什麼關係?
概念相似,Ollama 和 llama.cpp 解決文字大模型的本地推理,audio.cpp 想解決語音模型的本地統一服務。
可以接到自己的應用嗎?
可以。audio.cpp 提供 OpenAI 相容接口,只要應用支援填入 TTS 或 ASR 服務地址與模型名稱,就能接入本地語音服務。
by rainchu | 12 月 14, 2025 | AI , 影片製作 , 音樂
Tunee.AI 不只是能「生音樂」,它更厲害的是真正理解畫面、情緒與旋律邏輯 ,甚至可以把你生成的音樂直接自動拍成一支完整 MV 。 不是套模板、不是隨便剪,而是從音樂情緒出發,重新定義 AI 音樂創作流程。
這篇文章將完整帶你體驗 Tunee AI 的實際玩法,並解析為什麼它被稱為「Suno 殺手」。
👉 官方網站:https://www.tunee.ai/
🎵 圖片轉音樂|對話式圖片生音樂
Tunee AI 最讓人驚豔的功能之一,就是 「圖片 → 音樂」 。
你只需要上傳一張圖片,例如:
Tunee AI 會解析畫面情緒、色調與構圖 ,並透過對話方式詢問你想要的:
曲風(流行、抒情、電子、Lo-fi…)
情緒(憂鬱、溫暖、熱血、浪漫)
語言與人聲設定
這不是單向指令,而是真正的「對話式 AI 作曲體驗」,成品自然度遠超傳統 AI 音樂模板。
🎥 影片轉歌曲|影片解析生成完整歌曲
接下來這個功能,直接顛覆創作者的想像。
Tunee AI 可以: 👉 上傳影片 → 自動生成一首完整歌曲
系統會分析:
然後生成:
這對於:
幾乎是 一鍵完成專屬主題曲 ,效率直接拉滿。
🎼 風格化音樂生成
很多人用 AI 音樂最怕的就是:「學不像」。
Tunee AI 在「風格化生成」這一塊,表現非常成熟。 你可以指定參考曲目(例如:周杰倫《晴天》),但 不會抄旋律、不侵權 。
AI 只會學習:
生成的作品: ✔ 有熟悉感 ✔ 但旋律完全原創 ✔ 非常適合商用與創作發表
🌍 二創外文歌曲|AI 多語音樂製作
Tunee AI 在「語言與人聲」方面,也明顯優於許多 AI 音樂平台。
支援:
你可以進行:
外文歌曲二次創作
中文歌改英文版
不同語言同旋律版本
而且咬字自然、情緒到位,已經接近真人歌手水準。
🎬 AI 自動拍 MV|生成音樂 MV 長片
這一段,就是 Tunee AI 封神的關鍵。
Tunee AI 可以: 👉 把你生成的音樂,自動轉成一支完整 MV
不是簡單素材拼接,而是:
根據音樂段落切換畫面
副歌自動放大情緒張力
視覺節奏完全貼合旋律
生成的是「可直接上架 YouTube 的 MV 長片」, 對創作者來說,等於 音樂 + 影像一次完成 。
🔥 Tunee AI 為什麼被說是「Suno 殺手」?
功能 Tunee AI Suno 圖片轉音樂 ✅ ❌ 影片轉歌曲 ✅ ❌ 對話式作曲 ✅ ❌ 風格理解深度 高 中 AI 自動拍 MV ✅ ❌
結論只有一句話:Tunee AI 是一套「完整的 AI 音樂 + 影像創作系統」,不是只有生歌。
✅ 適合哪些人使用?
YouTuber / 短影音創作者
音樂創作新手
廣告、品牌行銷
想快速產出原創歌曲與 AI MV 的創作者
👉 官方入口:https://www.tunee.ai/
by rainchu | 12 月 19, 2024 | AI , 影片製作 , 語音合成 , 音樂
MMAudio 是一款開源的多模態影片轉音訊工具,透過多模態聯合訓練技術,可以將高品質的影片與音訊合成。該專案由伊利諾大學厄巴納-香檳分校、Sony AI 及 Sony 集團公司合作開發,適用於影片配音、虛擬角色語音等多媒體創作場景。
主要特色:
多模態聯合訓練: MMAudio 採用多模態聯合訓練方法,能夠同時處理影片和文字輸入,生成與內容同步的音訊。
高品質音訊合成: 透過先進的模型架構,MMAudio 能夠生成高品質且自然的音訊,適用於各類應用場景。
同步模組: MMAudio 的同步模組確保生成的音訊與影片畫面精確匹配,實現高度同步。
適用場景:
影片配音: 自動為無聲 影片生成對應的音訊,提升影片的可觀賞性。
虛擬角色語音生成: 為虛擬角色生成符合其動作和表情的語音,增強互動性。
多媒體內容創作: 協助創作者快速為視覺內容添加音訊,豐富作品表現力。
技術原理:
MMAudio 基於深度學習技術,特別是神經網路,理解和生成音訊資料。模型能夠處理影片和文字輸入,透過深度學習網路提取特徵,進行音訊合成。在訓練時,模型考慮音訊、影片和文字資料,使生成的音訊能夠與影片和文字內容相匹配。透過同步模組,確保音訊輸出與影片畫面或文字描述的時間軸完全對應,實現同步。
使用方法:
MMAudio 提供命令列介面和 Gradio 介面,使用者可以根據需求選擇使用。在命令列中,使用者可以透過指定影片路徑和文字提示,生成對應的音訊。Gradio 介面則提供了更友善的使用者介面,支援影片到音訊和文字到音訊的合成。
已知限制:
目前,MMAudio 存在以下限制:
有時會生成不清晰的語音或背景音樂。
對某些陌生概念的處理不夠理想。
相關資源:
by Rain Chu | 5 月 30, 2024 | AI , 音樂
MusicGPT 可以讓使用者能夠在本地使用大型語言模型 (LLMs) 根據自然語言提示生成音樂的功能,他的重點放在文字條件音樂生成、旋律條件音樂生成以及生成無限長或無限音樂流的能力,今天要說明 MusicGPT 如何作為 Suno.ai 的開源替代方案,有甚麼樣的特色有甚麼樣的優缺點。
文字生成音樂
MusicGPT 的文字生成音樂,可以讓用戶輸入描述性文字或情感語言,然後在本地端的系統將其轉化為相應的音樂作品。這一功能對於想要通過音樂增強其敘事的作曲家和故事講述者特別有用,像是YT、小紅書、抖音,能夠完美匹配文本中描述的情緒或場景。無論是反映平靜月光夜的寧靜作品,還是回響著繁忙城市興奮感的活力曲目,MusicGPT 都能適應輸入文本的細微差別。
旋律生成音樂
旋律條件音樂生成將創新推向更深一步,允許用戶輸入特定旋律,MusicGPT 則以此為基礎生成完整的作品。這一功能非常適合那些有旋律想法但需要協助將其發展成完整作品的音樂家和作曲家。MusicGPT 不僅保留原始旋律,還增加了和聲、節奏和配器,提供豐富、飽滿的音樂體驗。
無限長音樂流
MusicGPT 最突破性的功能之一是其生成無限長的能力。這一功能對於遊戲背景音樂、冥想應用程序或公共場所的環境聲景等應用特別吸引人。與傳統的音樂曲目不同,MusicGPT 的作品可以根據需要持續進行,不斷演變而不重複。這創造了一個動態的聽覺環境,可以持續適應聽眾的需求或互動。
Suno.ai 的開源替代方案
MusicGPT 不僅在技術進步上脫穎而出,也因其作為開源解決方案的可訪問性而受到關注。與可能運行專有技術的平台如 Suno.ai 不同,MusicGPT 提供了一種透明、可定制的方法。用戶可以在自己的系統上本地運行它,利用大型語言模型的力量根據自然語言提示生成音樂。這不僅確保了創作過程的隱私和控制,也促進了以社群驅動的發展,其中改進和變化可以由全球用戶共享和實施。
參考資料:
MusicGPT官網:https://www.music-gpt.xyz
原始碼連結:https://github.com/gabotechs/MusicGPT
by Rain Chu | 2 月 22, 2024 | AI , 影片製作 , 音樂
Kaiber.ai 是一款專注於二次元動漫和卡通風格的 AI 驅動視頻創作工具,這個平台的主要特色在於它能夠讓用戶輕鬆地創造出充滿二次元風格的影片,透過先進的 AI 技術,Kaiber.ai 為動漫愛好者和創作者提供了一個簡單且直觀的方式來生成具有獨特視覺風格的視頻內容。這款工具特別適合那些對動漫和卡通有特殊情感的用戶,希望在他們的視頻製作中加入這種獨特風格。更多有關 Kaiber.ai 的詳細信息,可以訪問它的官方網站 了解。
主要功能
音樂創作 Audioreactivity
動畫製作 Animation
圖片畫風轉換 Transform
分鏡製作 Storyboard
支援平台
App Store、 Google Play、 WEB
延伸閱讀
by Rain Chu | 2 月 6, 2024 | AI , 音樂
Mubert 是一個利用人工智能技術創造音樂的創新平台。它結合了對音樂創作的傳統理解和現代技術的創新應用,打開了音樂製作的新領域。Mubert 的核心理念是通過算法生成音樂,使音樂創作變得更加易於訪問和個性化。
首先,Mubert 的人工智能技術可以根據用戶的喜好和需求生成音樂。這種個性化的方法意味著每一位用戶都能得到獨特的音樂體驗,這在傳統音樂創作中是難以實現的。用戶可以指定音樂的風格、節奏、調性等,Mubert 的算法則會根據這些參數創造出相應的音樂。
其次,Mubert 開放了音樂創作的門檻。傳統的音樂製作需要專業知識和技能,而Mubert 使得沒有音樂背景的人也能創作音樂。這不僅促進了音樂的普及化,也為非專業音樂愛好者提供了表達自己的新途徑。
除此之外,Mubert 也被廣泛應用於商業領域。例如,在零售店、餐廳或活動中,可以利用Mubert生成符合特定氛圍的背景音樂。這種定制化的背景音樂有助於提升顧客體驗,並能根據不同場合和時間調整音樂風格。
簡單來說就兩種方法快速生成
文字生成音樂
選擇 My generated tracks ,然後在 prompt 中輸入文字
三個選擇產生音樂
Genres
在音樂領域中,”選擇 Genres” 指的是選擇音樂的風格或類型。音樂的風格(Genre)是對不同音樂類型的分類方式,它基於音樂的節奏、調性、儀器使用、作曲方式、歷史背景和文化影響等因素。
例如,一些常見的音樂風格包括:
搖滾(Rock)
爵士(Jazz)
古典(Classical)
電子(Electronic)
鄉村(Country)
嘻哈(Hip-Hop)
流行(Pop)
Moods
在音樂領域中,「Moods」(情緒)是指音樂所傳達的情感和氛圍。音樂的情緒是指作品所表現的感覺或情感狀態,它可以通過旋律、和聲、節奏和音色等元素來表達。不同的音樂情緒可以激發聽眾的不同情感反應,這是音樂表現力的重要組成部分。
例如,一些常見的音樂情緒包括:
快樂或愉悅(Happy or Joyful)
悲傷或憂鬱(Sad or Melancholic)
平靜或放鬆(Calm or Relaxing)
興奮或激動(Exciting or Energetic)
神秘或懸疑(Mysterious or Suspenseful)
浪漫或愛情(Romantic or Loving)
Activities
在音樂領域中,”Activities”(活動)指的是音樂與特定類型的活動或場景相結合的情況。不同類型的音樂適合不同的活動或場合,音樂的選擇可以根據活動的性質、氛圍、參與者的心情和需求來進行。
例如,一些與特定活動相關聯的音樂類型包括:
運動或健身時的音樂:通常是節奏快、激勵人心的音樂,幫助提升運動時的動力和精神狀態。
學習或工作時的音樂:往往是節奏較慢、較為平靜的音樂,有助於集中注意力和提高效率。
放鬆或冥想時的音樂:這類音樂通常柔和、平緩,有助於放鬆心情和身體,適合冥想或休息時聆聽。
派對或社交活動的音樂:這種音樂通常是節奏強烈、易於跳舞的,能夠營造歡快的氣氛。
睡前或安眠音樂:這類音樂通常非常平靜、輕柔,有助於放鬆和進入睡眠狀態。
就這樣,很簡單,需要商用的時候,就繳個 Pro 月租費
延伸閱讀
近期留言