Select Page

把兩台小型 AI 超級電腦接在一起,最先增加的不是單一請求速度,而是可承載的模型規模、上下文長度與同時服務能力,MSI EdgeXpert 採用 NVIDIA GB10 平台,每台有 128GB 統一記憶體,雙節點可讓 284B 的 DeepSeek V4 Flash、397B 的 Qwen3.5 MoE 與 230B 的 MiniMax M2 進入本地推理測試範圍。

我會把這類設備看成桌上型 AI 伺服器,而不是高階遊戲電腦,它最有價值的地方,是統一記憶體、低功耗、200GbE 高速互連,以及把敏感資料留在本地的能力,若只想偶爾聊天或寫程式,雲端 API 通常更省錢,若要處理長時間視覺串流、企業內網資料、批次 Agent 或需要 100GB 以上權重,本地設備才開始顯出意義。

MSI EdgeXpert 是什麼

EdgeXpert MS-C931 是基於 NVIDIA DGX Spark 平台思路打造的小型 AI 工作站,核心採 GB10 Grace Blackwell Superchip,把 20 核 Arm CPU、Blackwell GPU 與 128GB LPDDR5X 統一記憶體放進 151mm 見方的機身,重量約 1.2kg,儲存空間為 4TB NVMe M.2。

項目EdgeXpert 規格實際意義
處理器10 顆 Cortex-X925 加 10 顆 Cortex-A725適合資料處理、服務調度與模型前後處理
GPUNVIDIA GB10 Grace Blackwell6144 CUDA 核心,第 5 代 Tensor Core
統一記憶體128GB LPDDR5XCPU 與 GPU 共用,適合大型權重
記憶體頻寬273GB/s容量很大,但頻寬低於高階獨立顯卡
高速網路2 個 200GbE QSFP56可用雙鏈路連接兩個節點
一般網路10GbE RJ-45管理、檔案傳輸與區域網路服務
其他連接4 個 USB 3.2 Type-C、HDMI 2.1a、Wi-Fi 7、藍牙 5.4方便接相機、儲存裝置與顯示器
功耗140W TDP比傳統多卡工作站更容易放進辦公環境

GB10 與 RTX 5070 都有 6144 CUDA 核心,但定位完全不同,GB10 有 128GB 統一記憶體與最高 1000 AI TOPS,記憶體頻寬約 273GB/s,RTX 5070 只有 12GB GDDR7,頻寬約 672GB/s,前者能裝下大模型,後者在權重能完整放入顯存時通常跑得更快,容量和頻寬不能只選一個數字判斷。

雙機互連不是把速度直接乘二

兩個節點透過 QSFP56 連接後,模型權重會分散到兩台機器,每完成一層或一段運算,節點之間就要交換張量,這讓單台放不下的模型能夠執行,也能增加併發量,但同時帶來網路同步、序列化與等待成本。

  • 容量擴張:雙節點約有 256GB 統一記憶體可供系統與模型使用。
  • 模型並行:大型權重被切到兩台機器,任何一台故障都會讓服務中斷。
  • 鏈路聚合:兩條 200GbE 能降低通訊瓶頸,但收益取決於模型本身的計算與通訊比例。
  • 延遲代價:併發越高,P95 尾端延遲通常越明顯。

有人實際把四台同類設備做環形連接,確實能執行更大的模型,但速度不一定理想,節點增加後,容量會先變大,通訊路徑與維運難度也一起增加。這也是為什麼 273GB/s 記憶體頻寬與網路拓撲,比單看 AI TOPS 更值得注意。

三個大型 MoE 模型的雙機測試

測試固定使用 200G RoCE,透過 OpenAI 相容的 completions 介面送出三組工作提示。併發從 1、2、4、6 增加到 8,每個設定重複三次,觀察聚合吞吐量、P95 延遲、失敗請求與異常輸出。

模型總參數與啟用參數量化模型載入量每節點記憶體測試上下文
Qwen3.5 397B A17B397B、啟用 17BINT4 AutoRound約 226GB98.24GiB262K
DeepSeek V4 Flash284B、啟用 13BFP4 加 FP8約 160GB75.8GiB500K
MiniMax M2 AWQ230B、啟用 10BAWQ 4-bit約 121GB56.38GiB128K
MSI EdgeXpert 雙節點使用單鏈路與雙鏈路時的模型聚合吞吐量比較圖
雙鏈路對 Qwen3.5 與 DeepSeek V4 Flash 有明顯幫助,對 MiniMax M2 的增幅很小。資料為每組三次測試平均。
模型單鏈路 tokens/s雙鏈路 tokens/s增幅
Qwen3.5 397B42.348.113.5%
DeepSeek V4 Flash48.353.911.6%
MiniMax M2 AWQ123.4124.20.6%

結果很清楚,雙鏈路只會改善被節點通訊限制的模型,Qwen3.5 與 DeepSeek 的吞吐量分別增加約 13.5% 與 11.6%,MiniMax M2 幾乎沒有變化,代表它在這組設定下的主要瓶頸不在互連。

這組數字也不能直接拿來比較模型聰明程度,三者的量化格式、啟用專家數、上下文與模型大小都不同,MiniMax 速度最快,不代表回答品質最高,Qwen3.5 能用 262K 上下文啟動,DeepSeek V4 Flash 能用 500K 上下文啟動,這些容量優勢本身就是雙機部署的重要價值。

本地部署和 API 到底怎麼選

設備畫面標示單台價格為台幣 20 萬元,兩台還要加上高速線材、交換器、儲存與維護成本,若每月只是少量使用,雲端 API 很可能更划算,若每天持續分析大量影像、處理敏感文件、需要固定延遲,或模型呼叫量足以抵銷硬體成本,本地部署才有機會回本。

我比較在意的是混合部署,一般聊天與高難度推理交給雲端模型,持續監控、文件整理、影像理解與私有資料處理留在本地,這比要求一套設備取代所有 API 更務實,推理框架的選擇也會直接影響吞吐量,可以延伸閱讀 vLLM、SGLang、llama.cpp、MLX 與 Ollama 比較。若手上已經有 DGX Spark,也可參考 DGX Spark 搭配 llama.cpp 的部署筆記

JoyAI-VL-Interaction 不只是看圖問答

JoyAI-VL-Interaction 是京東 JoyAI 團隊開源的即時視覺語言互動模型。它採 8B 級規模,真正特別的地方不是再回答一張圖片裡有什麼,而是持續觀看直播流,自己判斷現在應該開口、保持安靜,還是把困難工作交給背景 Agent。

一般 VLM 是回合制。使用者先問,它才回答。JoyAI 把行動時機訓練進模型,每秒做一次決策。火爐上的鍋開始冒煙、運動員出現關鍵動作、商店貨架少了一項商品,都不必等人先提出問題。這讓它更接近監控助手、直播解說員與現場操作夥伴。

決策輸出適合情境
保持安靜silence畫面沒有重要變化,避免持續打擾
直接回應response 加文字即時提醒、解說、計數與操作指引
委派工作delegate 加任務需要搜尋、推理、程式或外部 API 的複雜問題

官方公開超過 400 萬筆時間對齊的視覺互動樣本,並用強化學習調整說話時機,系統以約 1 fps 接收影像,把短期畫面、問答紀錄與長期記憶一起交給 VLM,每累積一段畫面就壓成摘要,再把多段摘要整理成長期記憶。

這種架構很適合長時間串流,但仍要注意 token 成本,官方把 AdaCodec 描述為只對重要變化保留完整細節的預測式視覺編碼方向,實際部署時要確認目前下載的模型與服務版本是否已啟用對應能力,不能只看架構圖就當成預設功能。

JoyAI 可以做什麼

  • 居家安全:觀察煙霧、跌倒、危險區域與幼兒動作,在需要時主動提醒。
  • 體育與直播:即時解說、關鍵事件判斷、計數與彈幕式評論。
  • 零售與操作引導:辨識貨架、產品與手機介面變化,逐步帶使用者完成任務。
  • RTSP 監控:接入網路攝影機,讓視覺模型持續理解而不只是傳統動作偵測。
  • 企業背景 Agent:把需要查資料或產生報告的工作交給 Codex 或其他 API,同時不中斷眼前的畫面監看。

官方在 26 個離線理解基準的平均分數為 57.53,高於 Qwen3-VL-8B-Instruct 的 54.16。這不代表它在所有聊天問題都勝過大型閉源模型。它真正的優勢區,是視覺觸發的主動性、回應時機、時間感與長串流記憶。若想了解另一種文件與 OCR 導向的 VLM,可參考 InternVL3 本地多模態整理

JoyAI 完整部署命令

官方目前建議 Linux、NVIDIA GPU、CUDA 12.x、535 以上驅動與 Python 3.12。先從最小服務開始,確認視覺推理和 WebUI 能正常工作。

git clone https://github.com/jd-opensource/JoyAI-VL-Interaction.git
cd JoyAI-VL-Interaction

./install/install.sh --with-all
./install/download-models.sh --all

./services/scripts/run.sh minimal

啟動後在瀏覽器開啟以下網址。第一次使用會遇到自簽憑證提示,僅在確認是自己的主機後繼續。

https://127.0.0.1:8099

若需要語音輸入、語音輸出與背景 Agent,可以啟動完整服務。

./install/install-audio-runtime.sh --all
./services/scripts/run.sh all

完整系統預設把主 VLM 放在 GPU 0,摘要模型放在 GPU 1,ASR 與 TTS 放在 GPU 2。兩台 EdgeXpert 比較適合先跑最小服務,再把 ASR、TTS 或背景 Agent 改接另一台主機或外部 API。若把所有服務硬塞進同一組節點,記憶體餘裕與即時延遲都要重新測量。

需要完整語音體驗時,JoyAI 預設可搭配 Qwen3-ASR 1.7B 與 Qwen3-TTS 1.7B。想先了解本地聲音設計與 TTS 部署,可閱讀 Qwen3-TTS 音色設計與本地工作流

把雙機分工用在 JoyAI

雙機不一定要只跑一個超大模型。對即時視覺系統來說,服務分工可能更有效率。

  • 節點 A:JoyAI 主視覺模型、WebUI、攝影機或 RTSP 輸入。
  • 節點 B:摘要模型、ASR、TTS、向量資料庫與背景 Agent。
  • 高速鏈路:交換畫面摘要、長期記憶與委派結果,不必讓每一層模型張量都跨節點。
  • 雲端補位:只有複雜推理與大型搜尋才呼叫 API,平常監看留在本地。

這種拆法不會得到 256GB 的單一權重空間,但可減少模型並行的同步成本,讓即時互動更穩定。若目標是部署 284B 或 397B 權重,才改用跨節點模型並行。先定義工作負載,再決定是合併記憶體還是拆分服務。

隱私與維運不能省略

JoyAI 會持續接收相機與麥克風資料,本地部署能降低內容離開內網的機率,但不代表自動安全,WebUI、OpenAI 相容 API、RTSP、背景 Agent 與檔案權限都要分別控管。不要把服務連接埠直接暴露到公網,也不要讓背景 Agent 在沒有確認的情況下執行刪除、付款或外部發布。

模型判斷也會出錯。居家安全、工廠告警與醫療照護不能只依賴單一 VLM,重要事件應保留傳統感測器、規則引擎、人工複核與完整日誌。開放權重帶來可控性,也把測試責任交回部署者。

我的判斷

EdgeXpert 雙機最吸引人的不是把 tokens/s 翻倍,而是用 256GB 級統一記憶體打開大型 MoE、超長上下文與私有化多模態服務。雙 200GbE 對通訊密集模型確實有幫助,但 0.6% 到 13.5% 的差異也提醒我們,瓶頸可能在記憶體頻寬、模型計算、量化核心或排程。

JoyAI 更像這類硬體的合理應用,它不只等待問題,而是長時間留在場景裡,知道何時說話、何時安靜、何時交給另一個 Agent,真正值得做的不是把所有模型都搬回家,而是把持續、敏感、可重複的工作留在本地,把偶發而困難的任務交給更強的雲端模型。

參考資料

FAQ

兩台 EdgeXpert 會讓推理速度變成兩倍嗎?

不會。雙節點主要增加可用記憶體與併發空間。實測中雙鏈路讓 Qwen3.5 增加約 13.5%,DeepSeek V4 Flash 增加約 11.6%,MiniMax M2 只增加約 0.6%。

JoyAI 一定要三張 GPU 嗎?

最小服務只需要主視覺模型與 WebUI。官方完整預設才會把主模型、摘要模型、ASR 與 TTS 分配到三張 GPU。資源較少時可停用語音與背景 Agent,或把它們接到其他服務。

JoyAI 和一般 VLM 最大差異是什麼?

一般 VLM 多半等使用者提問。JoyAI 持續觀察即時畫面,每秒自主決定保持安靜、直接回應或委派任務,適合監控、直播、操作引導與長時間互動。

本地 AI 一定比雲端 API 便宜嗎?

不一定。低用量通常是 API 更便宜。本地部署適合高頻使用、敏感資料、固定延遲與需要客製化服務的人。評估時要把硬體、電力、儲存、網路與維護時間全部算進去。