by Rain Chu | 7 月 15, 2026 | 未分類
開源 TTS 最近很熱,但 dots.tts 值得特別看,原因不是只有聲音像,而是它把文字轉語音的路線又往前推了一步,它是一個 2B 參數的全連續端到端自回歸 TTS 系統,官方說明裡最關鍵的一句話是,整條管線不使用離散 token,而是用連續 latent 來完成語音生成。
如果你已經看過 Qwen3-TTS 的音色設計,或之前玩過 VoxelCPM 本地聲音復刻,dots.tts 可以放在同一條脈絡裡理解,以前很多 TTS 工具在可用性上已經不差,現在競爭點開始變成音色相似度、情緒穩定度、跨語言保真,以及能不能進一步做成即時語音 Agent 的底層能力。
先講結論
dots.tts 最適合被理解成一個偏研究與工程兼具的開源 TTS 底座。它不是只把文字念出來,而是把語意編碼器、LLM、自回歸 flow-matching 聲學頭、48 kHz AudioVAE 和 speaker x-vector 接成一條完整語音生成管線。
它目前最吸引人的地方有三個。
第一,官方釋出 pretrained、SCA 和 MeanFlow distilled 三種 checkpoint。
第二,SCA 版本主打更好的 voice cloning 表現。
第三,MeanFlow 版本用比較少的取樣步數換取推理速度,比較適合在產品或本地服務裡評估。
dots.tts 是什麼
dots.tts 是一個 2B 參數的 fully continuous end-to-end autoregressive text-to-speech 系統。官方 README 寫得很直接,它的骨幹由 semantic encoder、LLM 和 autoregressive flow-matching acoustic head 組成,底層則接 48 kHz AudioVAE。
這裡的重點是 fully continuous。傳統語音生成常會把聲音先離散化成 codec token,再讓模型預測 token,dots.tts 選擇不要走這條路,而是在連續 latent 空間裡處理語音。這個設計會讓架構更複雜,但它也讓音色、韻律和情緒細節有更大的保留空間。
三個 checkpoint 怎麼選
官方目前釋出三個 Hugging Face checkpoint,它們共用同一個 backbone,差別在品質、速度與對 voice cloning 的優化方向。
我會先從 dots.tts-soar 開始測,因為 voice cloning 通常是大家最在意的部分。如果要做服務化,才把 dots.tts-mf 拉進來比較延遲與硬體成本。
它的架構重點
官方架構可以拆成四層來看。AudioVAE 負責把 48 kHz mono waveform 編碼成連續 latent,也負責還原成聲音。Semantic encoder 會把新生成的 VAE patch 重新編碼成較緊湊的語意表示,LLM 由 Qwen2.5 1.5B Base 初始化,直接吃 BPE text。最後的自回歸 flow-matching acoustic head 則負責預測下一段聲音 latent。
這個設計有一個很有意思的方向。它不只是 TTS,也比較像是在替語音互動系統準備底座,官方提到 1T1A interleaved mode,可以讓一個 BPE token 和一個 audio step 交錯,目標是低延遲 streaming。這就會和 本地即時語音 Agent 的方向接起來。
數據上有多強
官方 benchmark 裡最直觀的是 Seed-TTS-Eval,dots.tts SCA 在中文測試的 WER 是 0.94,英文是 1.30,中文 hard set 是 6.60,平均 WER 是 2.95。這組數字和 Qwen3-TTS、CosyVoice 3、F5-TTS 放在一起看,已經是開源 TTS 裡非常前段的位置。
| 模型 | 參數量 | 英文 WER | 中文 WER | 中文 hard WER | 平均 WER |
|---|
| dots.tts SCA | 2B | 1.30 | 0.94 | 6.60 | 2.95 |
| Qwen3-TTS | 1.7B | 1.23 | 1.22 | 6.76 | 3.07 |
| CosyVoice 3 | 1.5B | 2.22 | 1.12 | 5.83 | 3.06 |
| F5-TTS | 0.3B | 2.00 | 1.53 | 8.67 | 4.10 |
平均 WER 越低代表文字內容錯誤率越低。這張圖只取官方 README 表格中的部分模型,方便快速比較。
另一個值得注意的是 MiniMax Multilingual,官方寫到 dots.tts SCA 的平均 speaker similarity 是 83.9,並且在 24 種語言裡有 19 種取得 SIM 領先,另有 2 種並列,這代表它的聲音相似度不是只在中文或英文好看,而是有跨語言保存音色的能力。
本地部署先看這幾件事
官方建議用 Python 3.10 到 3.12 開新的 conda environment,再從 source 安裝。這類語音模型通常對套件版本很敏感,所以我會照官方 constraints 跑,不會一開始就混用自己環境裡的 torch、transformers 或音訊套件。
conda create -n dots_tts python=3.10 -y
conda activate dots_tts
python -m pip install --upgrade pip
python -m pip install -e . -c constraints/recommended.txt
最小測試可以用 CLI。voice cloning 建議給一段乾淨 reference audio,官方建議大約 10 秒就好,太長不會帶來更好的結果。更重要的是 prompt text 要和 reference audio 實際說的內容一致,不一致會讓穩定度變差,甚至出現 word-level 錯誤。
dots.tts --model-name-or-path rednote-hilab/dots.tts-soar --text "這是一段語音合成測試" --prompt-audio /path/to/reference.wav --prompt-text "參考音訊實際說出的文字" --num-steps 10 --output clone.wav
我會怎麼測 dots.tts
第一輪不要急著做長文朗讀,先準備三種 reference audio,分別是乾淨女聲、乾淨男聲、帶一點情緒的自然說話,每段控制在 8 到 12 秒,背景聲音越少越好,然後用同一段中文、英文和中英混合文字跑三次,看它的穩定度和語言切換表現。
第二輪才測情緒與語氣,這裡不要只聽像不像,還要看文字內容是否漏字、重複、破音,還有語尾是否自然,TTS 如果只追求音色相似,很容易忽略可讀性,真正能進工作流的 TTS,應該是長時間輸出也不容易出錯。
第三輪測 streaming,官方 Python API 提供 generate_stream,這對語音助理、客服機器人、角色互動很重要,這也能和我之前整理的 audio.cpp 本地語音 AI 底座 放在一起看,未來本地語音工作流很可能會走向 ASR、LLM、TTS 都可替換的模組化架構。
限制也要先看清楚
dots.tts 不是所有語言都一樣穩,官方風險與限制裡提到,低資源語言會有 WER gap,特別是阿拉伯文、印地文、土耳其文、越南文這類資料覆蓋比較吃緊的語言,它可以保住 speaker similarity,但文字正確率不一定跟高資源語言一樣漂亮。
另一個限制是訓練資料偏 speech-heavy,AudioVAE 雖然原則上是 modality-agnostic,但這次釋出的模型不涵蓋唱歌,也不是統一的 speech 加 sound generation 模型。所以如果你的需求是歌曲翻唱、音效生成或完整聲音設計,它不是最直接的答案。
我的判斷
dots.tts 最值得關注的不是 3 秒復刻這種口號,而是它把開源 TTS 拉到更接近產品級底座的位置,2B 參數、連續 latent、自回歸 flow matching、SCA 對齊、MeanFlow 蒸餾,這些都不是單純 demo 型專案會一次放齊的東西。
如果你只是想快速產生中文旁白,現成工具可能更省事,如果你想研究本地 voice cloning、即時語音 Agent、跨語言音色保留,或把 TTS 放進自己的產品工作流,dots.tts 很值得列入測試清單。
延伸資源
FAQ
dots.tts 適合拿來做聲音復刻嗎?
適合評估,尤其是 dots.tts-soar。官方把它定位成 voice cloning 表現最好的 checkpoint,但實際品質仍取決於 reference audio 是否乾淨,以及 prompt text 是否和參考音訊一致。
dots.tts-mf 和 dots.tts-soar 差在哪裡?
dots.tts-soar 偏向品質與聲音復刻,dots.tts-mf 是 MeanFlow distilled student,官方建議 4 steps,目標是降低推理成本與提升速度。
參考音訊要多長?
官方建議大約 10 秒。更長不一定更好,乾淨、高取樣率、低背景噪音、自然說話,比單純拉長音訊更重要。
dots.tts 可以做唱歌或音效生成嗎?
不建議把它當成這類任務的主要方案。官方限制裡寫到這次釋出偏 speech-heavy,沒有覆蓋唱歌,也不是 speech 加 sound 的統一生成模型。
by Rain Chu | 7 月 15, 2026 | AI, 語音合成, 語音辨識
AI 數字人最容易卡住的地方,不是單一模型不夠強,而是聲音、口型、表情、角色圖像和剪輯工具分散在不同地方。Mossland 值得注意的地方,是它把語音創作和圖視頻生成放進同一個平台,讓「先有聲音,再有角色,再變成可交付內容」這條路更短。
這次重點可以拆成三個部分:
第一是 MOSS-TTS V1.5 這類更有情緒與控制能力的語音模型。
第二是 Bernini-R SVI 這類數字人動態表現端。
第三是 Mossland 作為創作平台,把音色庫、資產庫、工具集和 AVATAR 串起來。
先講結論
- Mossland 不是單純 TTS 網站,而是一站式 AI 語音與圖視頻創作平台。
- MOSS-TTS 的價值在聲音品質、音色控制、長文本穩定性和零樣本聲音復刻。
- MOSS-TTSD 補上多角色長對話,對播客、短劇、互動內容和教學旁白更有用。
- Bernini-R SVI 的定位可以放在「讓角色動起來」這一端,和 TTS 組合後才像完整數字人工作流。
- 如果你已經在研究 數字人模型與 RunningHub 工作流,Mossland 這類平台可以當作更偏創作者的整合入口。
Mossland 的平台定位
Mossland 官網把功能分成幾個入口:語音合成、音色設計、音頻轉寫、音色轉換、音頻降噪、圖視頻生成和 AVATAR 數字人。這個排列很清楚,它不是只做聲音,而是想把內容生產流程往後接到視覺端。
對創作者來說,這種平台最直接的價值是少切工具,以前可能要先用 TTS 生旁白,再到另一個工具做口型或角色動態,最後再進剪輯軟體,Mossland 的方向是把聲音、素材、模板和數字人放在同一個工作台裡。
這也跟 RunningHub 把 ComfyUI 工作流平台化 的邏輯相似,底層可能有多個模型和流程,但真正讓非工程使用者覺得好用的,是模板、入口、資產管理和可重複的工作流。
MOSS-TTS 的重點不是只會念字
MOSS-TTS Technical Report 把 MOSS-TTS 定位成語音生成基礎模型,它採用離散音訊 token、自回歸建模和大規模預訓練,並建立在 MOSS-Audio-Tokenizer 上。
真正值得注意的是控制能力,MOSS-TTS 支援零樣本聲音復刻、token 級時長控制、音素與拼音級發音控制、中英切換和長文本穩定生成。這些能力對數字人很重要,因為數字人不是只要聲音像,還要節奏、情緒和發音能配合角色。
如果你之前看過 Qwen3-TTS 和音色設計,就會知道現在開源語音模型的競爭,已經不只是「像不像真人」。更重要的是能不能穩定控制語氣、角色感、長句節奏和跨語言表現。
MOSS-TTSD 補上長對話和多角色
一般 TTS 很適合單人旁白,但數字人內容常常需要對話、角色切換和長時間穩定輸出,MOSS-TTSD 的定位就是 Text to Spoken Dialogue,可以從帶有說話者標籤的劇本生成多角色語音。
論文提到它支援最長 60 分鐘單次合成、最多 5 位說話者的多方對話,也支援用短參考音訊做零樣本聲音復刻。這對播客、動態解說、短劇、互動內容都很關鍵,因為真正有用的不是一小段試聽,而是能不能撐完整內容。
這也呼應我之前整理 本地語音 AI 統一底座 時的觀察:語音模型下一步要處理的不只是音質,而是長上下文、角色一致性、語者歸屬和整段內容的穩定性。
Bernini-R SVI 的角色:讓聲音變成可看的角色
如果 MOSS-TTS 負責聲音,那 Bernini-R SVI 這類模型就可以理解成數字人畫面端,也就是把角色圖像、動態表現、口型或視覺演出接上語音,讓內容從「一段旁白」變成「一個角色在說話」。
這裡最重要的不是單點能力,而是組合後的可交付性,單獨一個漂亮聲音不一定能變成短影音,單獨一張角色圖也不一定能支撐內容。但當語音模型和 SVI 數字人動態搭起來,就比較接近創作者每天能用的工作流。
這和 讓照片動起來的數字人方向 是同一條線,只是現在更重視整套內容管線,而不是單次展示。
Mossland 工作流怎麼看
| 階段 | 主要能力 | 對內容創作者的價值 |
|---|
| 聲音 | MOSS-TTS 語音合成與音色設計 | 讓角色聲音更自然且可控 |
| 對話 | MOSS-TTSD 長對話與多角色語音 | 適合旁白、播客、短劇與互動內容 |
| 畫面 | 圖視頻生成與 AVATAR 數字人 | 把聲音變成可交付的視覺內容 |
| 平台 | 音色庫、資產庫、工具集與 AI 應用 | 降低從素材到成品的組裝成本 |
Mossland 的價值在於把聲音、對話、畫面和平台工具接成一條內容生產線。
適合誰使用
第一類是短影音創作者。這類人需要快速產出角色旁白、社群內容、產品介紹和教學短片,平台化工具會比自己串模型更省時間。
第二類是品牌或電商內容團隊。商品介紹、活動宣傳、客服說明和直播切片都需要大量聲音與角色素材。只要品質穩定,數字人可以降低重複錄製成本。
第三類是 AI 工作流玩家。這類人可能仍會偏好本地部署,但可以把 Mossland 當作快速驗證平台,先看聲音和角色組合是否有市場感,再決定要不要回到本地工作流重做。
我會注意的限制
第一,聲音好不代表數字人就自然。角色表情、口型同步、鏡頭節奏、身體動作和背景設計都會影響成品。很多數字人看起來不自然,不是 TTS 的問題,而是視覺端沒有跟上。
第二,平台好用不代表資料風險消失。如果要上傳真人聲音、商業腳本或品牌素材,要先確認授權、隱私和使用條款。聲音復刻尤其要小心,最好只用自己有權使用的聲音。
第三,開源免費不等於零成本。模型、平台、素材整理、後製、審稿和版權確認都要算進去。真正的成本常常不是生成,而是讓生成結果可以被公開使用。
我的判斷
Mossland 這類平台反映了一個很明確的趨勢:AI 內容工具正在從單點模型,變成可組裝的內容生產線。TTS 模型負責聲音,SVI 或數字人模型負責角色動態,平台負責模板、資產和交付流程。
如果你只是想研究模型,MOSS-TTS 和 MOSS-TTSD 的技術報告值得看。如果你想做內容,重點應該放在「整條流程能不能穩定產出」。這也是我會關注 Mossland 的原因,它不是只展示某個模型,而是把語音和視覺創作接在一起。
對台灣創作者來說,我會先用它測三件事:中文語氣是否自然,角色畫面是否能承受社群平台放大檢視,整體流程是否比自己串 ComfyUI 或本地工具更省時間。這三件事過關,才有真正導入價值。
延伸資源
FAQ
Mossland 是什麼?
Mossland 是 MOSI Studio 的一站式 AI 語音與圖視頻創作平台,提供語音合成、音色設計、音頻轉寫、音色轉換、降噪、圖視頻生成與 AVATAR 數字人等功能。
MOSS-TTS 適合做什麼?
MOSS-TTS 是語音生成基礎模型,重點包含零樣本聲音復刻、發音控制、長文本穩定生成、多語言與中英切換能力,適合旁白、角色配音和內容生產。
MOSS-TTSD 和一般 TTS 差在哪?
MOSS-TTSD 面向多角色長對話,可以用明確說話者標籤生成長篇對話,支援多方對話、長時間合成和短參考音訊聲音復刻,更適合播客、短劇和互動內容。
Bernini-R SVI 在工作流中扮演什麼角色?
Bernini-R SVI 可以理解成影像和數字人動態表現端,MOSS-TTS 負責聲音,SVI 負責讓角色畫面跟聲音一起變成可交付內容。
Mossland 適合本地部署玩家嗎?
如果目標是研究模型或完全離線,本地部署仍有價值。如果目標是快速做內容,Mossland 這類平台的優勢是把音色庫、工具集、模板和 AVATAR 串起來,降低組裝成本。
by Rain Chu | 4 月 18, 2026 | AI, 語音合成
🧠 什麼是 VoxCPM?
VoxCPM 是由 OpenBMB 推出的新一代語音生成模型,主打:
👉 超低樣本聲音克隆(只需5秒)
👉 完全本地運行(無需雲端)
👉 多語言+多方言支持(30+)
簡單講一句話:
👉 它就是「語音界的 Stable Diffusion」
🚀 核心特色
🎙️ 1️⃣ 極致聲音複製(5秒搞定)
只需要一段短短語音(約5秒):
👉 幾乎達到「真人等級」
🎚️ 2️⃣ 專業播音員等級輸出
生成語音具備:
- 清晰度高(接近錄音室品質)
- 節奏自然
- 可長文本生成(Podcast / 有聲書)
👉 可直接商用(需注意授權)
🌏 3️⃣ 多語言+方言(重點)
支援:
- 中文(普通話)
- 台語(閩南語)
- 廣東話
- 四川話
- 英文 / 日文 / 韓文 等
👉 這點直接屌打很多 TTS 工具
🔒 4️⃣ 完全本地運行
不像:
- ElevenLabs(雲端)
- PlayHT(雲端)
VoxCPM:
✅ 無需上傳聲音
✅ 不怕資料外洩
✅ 無 API 費用
⚙️ 安裝教學(本地部署)
📦 硬體需求(建議)
- GPU:RTX 3060 以上(最佳)
- RAM:16GB+
- OS:Ubuntu / Windows(WSL)
🧩 Step 1:下載專案
官方 Repo👇
👉 VoxCPM GitHub repository
🧩 Step 2:安裝環境
🧩 Step 3:下載模型
依照 repo 指示下載:
🧩 Step 4:執行推理
🧩 Step 5:使用WEBUI
# WebUI
python lora_ft_webui.py # http://localhost:7860
🧠 進階玩法(你可以做什麼)
💰 商業應用
- AI 配音 SaaS
- 有聲書生成平台
- YouTube 自動旁白
🧪 高階玩法
- 聲音角色庫(多人 voice profile)
- Telegram 語音 Bot
- 客製客服語音
⚠️ 注意事項(很重要)
⚙️ 技術限制
🆚 VoxCPM vs 其他 TTS
| 工具 | 本地 | 聲音克隆 | 方言 | 成本 |
|---|
| VoxCPM | ✅ | ✅ | ✅ | 免費 |
| ElevenLabs | ❌ | ✅ | 普通 | $$$ |
| PlayHT | ❌ | ✅ | 普通 | $$$ |
👉 結論:
本地部署 = VoxCPM 完勝
參考資料
官方網站
移除背景聲音工具(UVR5)
by Rain Chu | 9 月 11, 2021 | NFC, Raspberry Pi, 幼兒園, 科技
最近接到一個很有意義的任務,一個大型幼兒園提出,最近Cov-19的疫情下,都不准家長進入幼兒園,也想要減少家長來接送小孩時候的接觸,不知道有沒有甚麼好的科技手段可以解決在Cov-19的疫情下,讓家長不用說話也不用接觸,並且來接小孩的時候,幼兒園就可以知道,是那位小朋友要出去?
分析問題如下:
- Cov-19的疫情下,不希望過多的接觸
- 最好可以家長免下車,幼兒園就可以知道那位小朋友的家長來接送了
- 成本要低,並且不要為了解決一個家長接送的問題,搞得幼兒園需要處理很多事情,讓流程反而複雜化了
解方如下:
- 利用家長卡(RFID)可以不用接觸,就可以得知是那位孩童的家長到了
- 利用AI語音合成,當家長卡靠卡的時候,利用Microsoft的語音合成服務,提供自然且流暢的語音,提醒幼兒園那位小朋友的家長來了
家長接送樁,相關硬體準備如下:
廣播主機,家長接送區的靠卡行動樁,以及家長卡,蜂鳴器(喇叭)、NFC讀卡機
家長接送樁,相關軟體規畫如下:
- Google 合成語音
- Microsoft 合成語音
- 訊飛 合成語音
- Web Server 接收指令
- Web Client 發送指令
- 資料庫 家長與學生的資料庫
家長接送樁,作法如下:
- 建立家長與學童的資料庫,建立其對應關係
- 將學童的呼叫語音,透由AI程式預先合成自然且流暢的語音,並且放於廣播主機中
- 撰寫家長接送樁的RFID(NFC)的讀卡程式,並且透過內部網路,發送讀取到的卡片資訊傳送到廣播主機上頭
- 廣播主機對應資訊,並且透過音響廣播到教室區
採用家長接送樁主機的好處:
- 全程不用下車,也不用接觸物品,人員,靠卡就可以呼叫小朋友出來
- 節省人力,無論是刮風下雨、大熱天、颱風天等等,都可以讓家長接送樁,來幫忙家長服務
- 可靠性佳,不用怕認錯人,也不用怕小朋友被壞人接走
- 成本低,一套設備下來,包含備援,準備兩組設備也不到一個人的月薪
夏恩英語FB
夏恩幼兒園 林口翰科旗艦校 最具世界競爭高度的國際級幼兒園
翰科教育林口國際幼兒園
妳也可以用小米手環呼叫小朋友
怎麼把門禁卡變手環
近期留言