by Rain Chu | 10 月 5, 2026 | Agent, AI, OpenAI
OpenAI Dots 是 ChatGPT 裡能持續追蹤工作、協調工具並交付成果的常駐 AI 代理,跟 hermes agent, openclaw 是一樣的 AI 工具,你可以用文字或語音交代目標,讓它在自己的雲端電腦上研究、整理文件、寫程式,再回來查看結果。
我會把 Dots 看成工作的協調入口。遊戲引擎、建模軟體與筆記工具本身並沒有消失,Dots 把它們接成一條可以持續修改的流程。這篇先整理建立方式與典型案例,再釐清方案、用量和電腦權限。
Dots 是什麼?讓同一個目標跨對話繼續推進
依 OpenAI 官方介紹,Dots 由 GPT-6 Astra 驅動,擁有獨立雲端電腦與瀏覽器,並透過外掛連接工作應用。
官方公布的超過 4,000 個應用,是生態系的涵蓋範圍,實際能用哪些工具仍取決於外掛、帳號、權限和執行環境。
任務與記憶文件說明,它可以分派背景工作並同步推進多個任務,你在同一段對話中補充需求或改變優先順序,Dots 再協調後續步驟,它是統籌工作的一層,不代表所有動作都由同一個對話中的模型直接執行。
若你已經用過 ChatGPT Work 與 Codex 的任務流程,可以把 Dots 理解成持續接收目標、追蹤進度與回收成果的入口,Work 和 Codex 仍負責各自任務中的執行,舊文章中的模型與方案資訊則要以目前官方文件為準。
怎麼建立第一個 Dot
先在 ChatGPT 桌面 App 或電腦網頁建立 Dot,依引導設定名稱與外觀,電子郵件、行事曆和檔案服務可以在設定時連接,也能先跳過,完整步驟可對照 官方入門指南。手機 App 的使用需等支援更新到位,目前不能在手機網頁建立或使用 Dot。
建立後,先交一件範圍小、容易確認結果的工作,例如整理指定筆記頁並回傳摘要。等它能讀到正確資料,再增加寫入或跨工具操作。名稱與動態頭像方便辨識,但實際能力仍要看它取得的資料與工具。
三種連接要分清楚
- 通訊管道:在 ChatGPT、Slack 或 Teams 聯絡同一個 Dot。
- 外掛與應用:提供特定服務的資料與操作能力。
- 本機電腦:讓任務使用該電腦上的檔案、程式與工具。
加入 Slack 並不等於同時連接 Gmail,也不等於允許它讀取你的電腦,依 電腦與應用指南,這些連接各自管理。雲端瀏覽器也有自己的登入狀態,不會自動沿用你個人 Chrome 的所有帳號。
六個工作情境:從說出需求到拿到成品
以下案例整理公開操作流程,並補上本文建議的驗收方法。它們展示的是個別任務的可行性,沒有建立大型專案成功率或長期無人值守的測試結論。
一、語音查論文
依 官方語音說明,可從 Dot 對話的電話按鈕開始通話,通話期間也能打字補充。結束通話後,已交付的工作仍可能繼續。目前不能把它當作已能主動打電話給你的助理。
二、把每日檢查存成定時任務
每日檢查專案倉庫,以及定時查看 OpenAI 是否發布新文章,是把追蹤工作保存成排程的兩種用法。設定成功只是第一步,之後是否準時執行、能否持續取得來源,以及結果是否符合條件,都需要另外確認。
接下來兩週,每個工作日上午九點,以 Asia/Taipei 時區檢查[指定來源]。整理新增或變更項目到[指定位置],沒有變更時保持安靜。遇到[需要決策的條件]才通知我。請確認保存的時間、來源與輸出位置,第一次執行後提供紀錄。
上面的指令是本文示例。排程要包含時區、期間、通知條件與交付位置。依 定時任務指南,連接 Slack 或其他來源不會自動建立監控,應請 Dot 確認已保存的工作,再到 Scheduled 檢查。
三、Blender 建 3D:模型檔和渲染圖一起交付
同一個 Dot 可以協調不同工具任務,讓需求繼續在背景執行。
模型驗收除了看渲染圖,也要打開原始檔,確認物件、材質、相機和燈光都可再修改。若要交給別人,還要檢查外部貼圖與依賴是否一同保存。漂亮圖片只能說明某個視角的效果,不能代替可編輯模型的檢查。
如果要延伸到動畫或產品視覺,可參考 Blender 與開發代理的視覺工作流程,先定義短樣本與代表畫面,再擴充整段作品。工具已經接上,仍需要清楚的設計與交付規格。
哪些方案能用?用量怎麼算
截至 2026 年 10 月 2 日,Dots 正逐步開放給符合地區條件的 Pro、Business Premium 與 Enterprise 使用者,Pro 的推出範圍排除歐洲經濟區、英國及瑞士,Enterprise 需要管理員啟用,符合資格也可能尚未輪到帳號,不能因為一時看不到入口就判定設定有問題。最新條件請查 方案與地區說明,目前不能把 Plus 當成已支援的方案。
第一個 Dot 包含在 Pro 或 Business Premium 方案內,深入工作仍有使用額度。
Dot 對話不計入 ChatGPT 用量,但它啟動或管理的 Work/Codex 任務會照常計入那些產品的限制,首月提高上限不代表永久無限,細節以帳號顯示與 官方用量說明為準。
這也影響值不值得升級的判斷。只偶爾需要一段程式碼,可以先看既有工具是否已足夠。
若你經常需要追蹤研究、跨應用更新、定期整理資料,再比較 Dots 能省下多少來回交代與驗收時間,會比只看一次展示更有用。
如何把任務交代到可以驗收
一個好任務至少要有來源、結果、限制和完成條件。下面是本文設計的起手式,可以替換方括號內容後使用。
請使用我已連接的[資料來源],完成[具體結果]。先確認你讀到的來源,再開始處理。輸出到[位置與格式],保留來源連結與修改紀錄。涉及發送、公開分享或覆蓋原始資料時,先給我確認。完成後提供成果位置與檢查結果,遇到缺少權限或資訊時說明缺少什麼。
這樣的描述方便驗收,也方便續做。若第一版錯了,指出具體段落、檔案或操作步驟,讓它修正同一件工作。單純說「做得更好」通常只會增加猜測。
雲端能繼續工作,本機仍需要連線
Dots 的雲端電腦可在你的裝置關機時持續處理雲端工作,需要你本機檔案或工具的任務,則必須先授權連接該電腦,並保持電腦上線與 ChatGPT App 開啟,目前一次只能連接一台個人電腦。
要查看雲端環境,可從 Dot 個人頁的 Computers 開啟電腦,開啟畫面後仍需選 Take over 才能接管,完成登入或確認步驟後再 Return control。
遇到網站額外驗證或雲端瀏覽器被阻擋,可能需要人工接手,不能承諾每個網站都能全程自動完成。
長期合作前,先理解記憶與權限
Dots 可以使用相關 ChatGPT 記憶,也會保存自己的工作脈絡。
這不等於它永遠保有所有歷史對話,更不等於每個被分派的任務都取得完整歷史。重要文件、決策和來源仍建議明確保存,若想把專案知識做成可維護的資料,可延伸看 Agent 共用知識庫的整理方式。
依 隱私與安全 FAQ,斷開外掛會停止後續存取,已進入 Dot 脈絡的資訊不會因此自動刪除,目前也不能逐條直接修改 Dot 的自有記憶。刪除 Dot 與管理 ChatGPT 記憶是不同操作,刪除前先保存需要的成果。
個人方案的對話與工作是否用於模型改進,依資料控制設定。Business、Enterprise 與 Edu 工作區預設不使用內容訓練。主動研究與筆記不直接拿來訓練,但資訊若被帶入符合條件的對話或任務,仍會依設定處理。
OpenAI 的安全設計包含隔離環境、私密登入與操作審查,主動研究本身使用唯讀工具,不能直接寄信、修改應用或控制電腦。已授權的任務若要採取後續動作,仍受權限與操作規則限制,把工作交給 Dots 後,重要結果一樣要檢查。
怎麼查看進度與停止工作
從個人頁的 Activity 查看進行中與委派任務,再到 Scheduled 檢查定時工作。
依 官方控制說明,暫停 Dot 主任務、停止委派任務和取消排程有不同效果,若要全面停止,必須分別檢查這些位置,關掉通話或暫停主對話不會自動取消所有後續工作。
我的建議:從一條能穩定交付的流程開始
第一次使用,我會先選「讀取指定資料、產出草稿、回傳來源」這種容易確認的工作。
確認資料與輸出都正確,再增加跨工具寫入、排程或程式開發。持續記錄完成率、修正次數與實際用量,才能知道它是否適合你的工作。
Dots 的價值在於持續協調和回收成果,短時間完成一個遊戲或模型值得參考,能否長期減少管理成本才是後續要驗證的事。
資料核對日期:2026 年 10 月 2 日。功能與案例依公開資料整理,本文未另外重跑相同測試。方案、地區與用量會更新,使用前請確認最新官方說明。
OpenAI Dots 常見問題
OpenAI Dots 是什麼?
Dots 是 ChatGPT 裡能持續追蹤目標的 AI 代理。它有自己的雲端電腦,可協調研究、文件、程式與其他工具工作,再回收成果。
ChatGPT Plus 可以使用 Dots 嗎?
截至 2026 年 10 月 2 日,官方列出的開放方案是符合條件的 Pro、Business Premium 與 Enterprise。Plus 尚未列為支援方案,實際資格也受地區、管理員設定與逐步推出影響。
Dots 會消耗 Codex 額度嗎?
Dot 對話不計入 ChatGPT 用量。它啟動或管理的 Work 與 Codex 任務,仍照常計入那些產品的用量限制,不能當成無限工作額度。
電腦關機後,Dots 還會工作嗎?
雲端電腦上的工作可以繼續。需要使用本機檔案或工具的任務,則要保持該電腦上線,並開啟已授權的 ChatGPT App。
結束通話或暫停 Dot,會取消所有排程嗎?
不會。結束通話不會自動取消已交付工作,暫停主對話也不等於停止所有委派任務與排程。請分別檢查 Activity 和 Scheduled。
by Rain Chu | 9 月 27, 2026 | Agent, AI, 程式開發
Pi Agent 非常適合想自己決定 AI 寫程式流程的人,它把讀檔、寫檔、修改與執行命令放在小巧的核心裡,再透過擴充與模型設定增加能力,真正有用的地方,是你可以在同一段工作裡切換模型,回到先前的對話節點,重新探索另一種方案。
但輕量不代表不用設定,也不保證每次都比較省錢,要先分清楚擴充程式、專案規則、對話紀錄與檔案版本各自負責什麼,後續才不會把對話切回去了,卻以為程式碼也自動還原。
Pi Agent 是什麼?先理解它負責哪一層
Pi Agent是一套以終端機為主的 AI Coding Agent,也常被稱為 Agent Harness。
你可以把 Harness 理解成模型的工作環境,負責把請求、上下文、工具呼叫與執行結果串起來。模型決定下一步,Pi 則讓它能接觸專案檔案與工具。
預設核心工具是 read、write、edit 與 bash。計畫模式、子代理與 MCP 整合不是核心預設配備,可以再用擴充或套件補上。因此,適合的起手式是先用基本能力完成小任務,再增加確實需要的功能。
Pi 也提供不同的接入方式,日常操作用互動終端介面,單次自動化可用 print 或 JSON 輸出,需要其他程式控制時可走 RPC,想嵌入自己的應用則使用 SDK。
RPC 文件與SDK 文件適合留到需要整合時再看。
安裝 Pi Agent:使用目前官方套件名稱
截至 2026 年 9 月 12 日,官方快速入門採用的 npm 套件名稱是 @earendil-works/pi-coding-agent。較舊教學可能使用不同命名,請以官網當下的指令為準。
目前套件設定要求 Node.js 22.19.0 以上,安裝前先確認環境。
node --version
npm install -g --ignore-scripts @earendil-works/pi-coding-agent
pi --version
--ignore-scripts 會停用安裝期間的套件生命週期腳本,官方說明一般 npm 安裝不需要這些腳本。看到版本資訊後,切換到要處理的專案目錄,再啟動 Pi。
cd /path/to/your-project
pi
上面的專案路徑要換成自己的資料夾,第一次練習可使用測試專案,先請它整理目錄、說明啟動方式與現有檢查項目,確認理解正確後再開始改程式。這樣也比較容易看出模型是否能正確使用工具。
模型接入:登入、API Key 與自訂端點分開處理
進入 Pi 後,先用 /login 設定模型服務,再用 /model 選擇模型,服務商文件列有訂閱登入與 API Key 兩種主要方式,可用選項取決於服務商、帳號與目前版本。
常用設定位於 ~/.pi/agent/。auth.json 保存驗證資料,models.json 用來加入自訂模型或端點,settings.json 管理偏好,sessions/ 保存對話。
專案自己的偏好放在 .pi/settings.json,有助於把個人習慣和團隊設定分開。
如果模型服務使用支援的相容 API,可依自訂模型文件填入端點、API 類型與模型 ID。
以下是設定結構範例,網址與模型名稱都是待替換值,不是可直接連線的服務。
{
"providers": {
"my-provider": {
"baseUrl": "https://your-provider.example/v1",
"api": "openai-completions",
"apiKey": "$MY_PROVIDER_API_KEY",
"models": [
{
"id": "your-model-id"
}
]
}
}
}
將真正的金鑰放進 MY_PROVIDER_API_KEY 環境變數,設定檔保留變數參照即可。修改 models.json 後重新開啟 /model,Pi 會重新讀取。模型沒出現時,依序檢查 JSON 格式、驗證資料、模型 ID 與 API 類型。端點能聊天,也不一定代表工具呼叫完全相容。
Extension、Skill 與 Package 差在哪裡?
Extension 是會執行的擴充程式,通常以 TypeScript 撰寫,可以註冊工具、加入斜線命令、監聽事件、調整終端介面,或改變工具執行方式,例如,替特定命令增加確認流程,就是執行時的能力。
擴充文件提供 API 與範例。
Skill 是可重複使用的工作方法。它把說明與相關資源整理成一個任務單元,適合審稿、部署檢查或特定程式庫的使用流程,Pi 先讓模型知道有哪些技能,需要時再讀取完整內容。,看如何把方法寫成可重用流程,可以延伸閱讀站內的diagram-design 技能教學,再對照Pi 的技能載入規則調整。
Package 是安裝與分享的容器。它可以同時包含 Extension、Skill、提示詞範本與主題,也可以只有其中一種。
Pi Package 文件規定資源可在 package.json 的 pi 欄位宣告,或使用約定目錄。
Extension 和 Package 因此不是二選一的替代品。
安裝前先看套件作者、原始碼與支援版本,pi install 預設寫入個人設定,加上 -l 則用於專案範圍。可以用 pi list 檢查已安裝套件,資源修改後用 /reload 重新載入。
AGENTS.md 怎麼分層?override 只取代同層檔案
Pi 會在啟動時載入全域、父目錄與目前目錄的上下文檔案。全域的 ~/.pi/agent/AGENTS.md 可放常用語言與共通習慣,專案的 AGENTS.md 則放技術選擇、執行方式與驗收條件。
啟動畫面會列出已載入的檔案,可先核對是否符合預期。
依官方使用說明,同一個目錄若有 AGENTS.override.md,Pi 會改讀它,取代該目錄的 AGENTS.md 或 CLAUDE.md。
其他目錄的上下文仍會一起載入。這不能簡化成「有 override 就清空全部規則」,也不宜只靠一句優先級口訣管理互相矛盾的要求。
以賽車遊戲為例,專案規則可以寫得很具體,先限制第一版的範圍,再定義怎樣算完成。
# 專案工作規則
- 使用現有專案的技術,不另換框架
- 第一版先完成操作、碰撞、計時與重新開始
- 相機視角需先確認,再實作渲染方式
- 修改後執行專案既有檢查
- 回報改動、驗證結果與尚未解決的問題
這些是給模型讀取的指示,不是作業系統的權限限制。
若還有跨專案的知識要保存,可參考讓不同 Agent 共用專案知識的方式,避免把所有背景資料塞進每次啟動都載入的檔案。
專案信任不等於沙箱,pi-sandbox 也有適用範圍
Pi 的專案信任機制,決定是否載入專案內的設定、技能、套件與擴充,單純建立空的 .pi 目錄,不一定會出現信任提示,拒絕信任後,受保護的專案資源會略過,但 AGENTS.md 等上下文仍可能載入。
官方安全文件明確說明,這套機制不是沙箱。
Pi 本身會以啟動帳號的權限讀寫檔案與執行命令。若需要執行隔離,應依工作情境選擇容器、虛擬機或作業系統層的沙箱,只在提示詞裡要求「不要碰其他檔案」,不能取代這些限制。
carderne 的 pi-sandbox是一個可選的第三方擴充,為檔案工具加入規則,並透過 sandbox runtime 控制 Bash 的檔案與網路存取。它會在部分被擋下的操作上顯示授權提示。確認作者與套件名稱後,可依其文件安裝。
pi install npm:pi-sandbox
這個套件的 macOS 與 Linux 說明要求環境能找到 rg,設定位置包含全域的 ~/.pi/agent/sandbox.json 與專案的 .pi/sandbox.json。不同同名專案的格式不一定相同,不要混用範例。
Session Tree:保留探索路徑,也要另外保存程式碼
Pi 將對話存成樹狀 JSONL,預設放在 ~/.pi/agent/sessions/,並按工作目錄整理。每筆紀錄透過 ID 與父節點連接,因此可以在同一段對話裡保留不同嘗試。Session 文件對分支與選取行為有完整說明。
pi -c
pi -r
pi --name "racing-game-prototype"
上面三行是不同的啟動方式,依需要擇一。
pi -c 延續最近的對話,pi -r 選擇歷史紀錄,--name 則為啟動的對話設定名稱。進入 Pi 後,也可以用 /session 查看目前紀錄。
/tree 在同一份對話檔案內切換路徑,選取先前的使用者訊息時,原文字會回到編輯區,修改後送出就能展開另一條分支。若想從先前某個問題建立獨立對話,用 /fork,若要複製目前整條使用中的分支,則可用 /clone。
對話樹保存的是討論歷史,不能視為程式碼快照,切回舊節點時,磁碟上的檔案仍可能保留後續修改,要比較兩種實作,應另外使用 Git commit、分支、worktree 或獨立副本保存成果,再確認目前工作目錄和所選對話相符。
切換分支時,Pi 可以摘要離開的路徑,將重要資訊帶到新位置,若是同一需求的改良版,可保留問題與結論。若要獨立比較方案,則要留意摘要是否把原方案的假設帶了過去,長對話也可用 /compact 整理上下文,但摘要會取捨資訊,關鍵規格仍適合寫回專案文件。
用賽車原型練習:先計畫、再審查、最後驗收
一個好練習,是讓 Pi 先規劃俯視賽車原型,再嘗試固定追尾視角。重點不是一次做出完整遊戲,而是讓需求變動時,仍能追溯決策與保留可用版本。
第一步:先把驗收條件講清楚
先要求它列出操作方式、相機位置、碰撞、計時與重新開始等最小功能,暫時不要實作。把「做一個好玩的遊戲」改成可以檢查的條件,例如按鍵方向一致、失敗後能重新開始、相機不因轉彎而失去方向感。
第二步:切換模型審查計畫
用 /model 切到另一個模型,請它檢查計畫中缺少的條件、技術風險與需要確認的選項。這是同一段對話中的模型交接,不是同時啟動多個代理。分工可以是較快的模型整理方案、另一個模型審查關鍵設計,但是否更划算,需要用自己的任務驗證。
第三步:跑起來,檢查可操作性
程式生成後,要實際啟動並檢查操作、碰撞與視角。能開啟頁面,只代表基本流程可執行,不代表遊戲已完成。若俯視版本相機不穩,先保存檔案版本,再用 /tree 回到需求確認點,提出固定追尾視角的新方案。
執行途中想補充方向,可以送出 steering 訊息。想等目前工作完成後再追加任務,則使用 follow-up。預設快捷鍵分別是 Enter 與 Alt+Enter,實際可用 /hotkeys 確認。排隊訊息不是撤銷已執行操作的功能,緊急停止與後續修正仍要分開處理。
Pi 和 Hermes 怎麼選?先看你想完成哪種工作
Pi 適合想掌握本地開發流程、逐步組裝能力,或把 Agent 嵌入自己應用的使用者,Hermes Agent則提供記憶、技能累積、通訊平台接入與排程等較完整的個人助理能力。這是產品方向的差異,不足以直接推論哪一個寫程式一定比較強。
如果需求是從通訊軟體交辦長期工作,可以先看看站內的Hermes 與通訊平台整合,如果主要工作是對著專案反覆改程式,Pi 的對話樹與可擴充介面值得試用,偏好圖形工作台的人,也可比較OpenWork 本地 Agent 工作台的操作方式。
成本方面,不能只比較初始系統提示詞的長度,完整帳單還受模型價格、工具輸出、重試次數、快取與最後是否完成任務影響,Pi 顯示的用量和費用適合追蹤趨勢,自訂模型的價格設定也要正確,結算仍以服務商帳單為準。
常見問題
Pi Agent 是模型嗎?
不是。Pi 是讓模型讀寫檔案、呼叫工具與管理對話的工作環境,需要另外接入可用的模型服務。
Pi Agent 的 Extension 和 Package 有什麼不同?
Extension 是執行時的擴充程式,Package 是安裝與分享資源的容器,可以包含擴充、技能、提示詞與主題。
AGENTS.override.md 會取代所有規則嗎?
不會。它取代同一目錄的 AGENTS.md 或 CLAUDE.md,其他目錄的上下文仍會載入。
Pi 的 /tree 會還原專案檔案嗎?
不能把 /tree 當成檔案還原工具。它切換對話路徑,程式碼版本需要另外用 Git 或其他快照方式保存。
第一次使用,先完成一個能驗收的小任務
先接通一個模型,寫一份精簡的專案規則,請 Pi 完成小修改並說明驗證結果。熟悉之後,再加入真正需要的擴充,練習模型交接與對話分支。當每次嘗試都有清楚的需求、可追溯的討論與獨立保存的檔案版本,這套輕量工具才會成為可靠的開發流程。
by Rain Chu | 9 月 25, 2026 | Agent, AI, 模型
Laya 提供了可以在本機執行的開源決策模型,但目前還不足以支持「直接取代 Jev」,在相同的垃圾簡訊與銀行客服分類樣本上,Jev 的準確率較高,Laya 則在 Apple M3 上呈現較短的實際等待時間。
Laya 是什麼?把語意轉成程式可用的判斷
Laya 接收文字或結構化狀態,再依你定義的問題回傳選項、分數或機率。它採用非自回歸架構,經由編碼器理解輸入,再由決策頭評估候選答案,省去逐字生成回答與解析自由文字的步驟。
可以用一張客服單理解三種題型:
choice 判斷要分給帳務、技術還是業務,score 依事先描述的等級評估急迫性,noul 回傳「客人是否明確要求退款」這類命題成立的機率。
這與 TypeSafe 的 System One 設計有相近的工作分工,需要分類、分流與檢查時使用決策模型,需要撰寫回覆時再接生成模型,想先了解實際如何串接,可以參考 Jev 的五個工作流場景。
Laya 英文模型卡列出的基礎版本採用 ModernBERT-large,總參數量約 4.21 億,權重採 Apache 2.0 授權。
另有多語言與 typed-decisions 等 checkpoint。這次受測的是英文基礎版,沒有為這兩份評測資料另外微調,不能把其他版本的分數直接套過來。
Laya 的 開源專案也提供相容 Jev 請求形狀的介面,能降低改接服務的工作量。
這次比較怎麼做?先把版本與條件固定
依 公開評測紀錄,Laya 測試日期為 2026 年 9 月 23 日,使用 Laya 0.3.11、英文 convaiinnovations/laya checkpoint,以及 Apple M3 的 MPS 加速。Jev 沿用 9 月 20 日透過 OpenRouter 取得的 jev-1.13 原始回答,兩者並非同一時間重新呼叫。
- SMS Spam:200 則英文簡訊,其中 27 則垃圾訊息、173 則正常訊息。
- Banking77:462 則英文銀行客服訊息,77 個意圖各取 6 則。
- 兩邊使用相同的樣本 ID、輸入狀態、正確答案與題目設定,再由同一份評分程式計算結果。
- Laya 在本機逐筆執行,Jev 走雲端服務。延遲反映這兩條實際執行路徑,並非相同硬體下的模型速度測試。
核對資料時,官網已列出 0.3.20 的更新內容,下文數字應視為 0.3.11 英文基礎版的固定評測,不是對所有新版本、所有語言或微調模型的總排名。
範例一:垃圾簡訊二分類,84% 準確率該怎麼看?
這個任務只問一件事:簡訊是不是垃圾訊息。評分程式把 noul 大於或等於 0.5 的回答判成垃圾訊息,再與資料標籤比較。Jev 答對 193 則,Laya 答對 168 則。
| 任務 | 模型 | 答對 / 樣本 | 準確率 | Macro F1 |
|---|
| SMS Spam | Jev | 193 / 200 | 96.5% | 0.926 |
| SMS Spam | Laya | 168 / 200 | 84.0% | 0.759 |
| Banking77 | Jev | 377 / 462 | 81.6% | 0.806 |
| Banking77 | Laya | 183 / 462 | 39.6% | 0.346 |
資料:01Coder 公開評測,Laya 0.3.11 英文基礎版。本文已由原始回答重新核算答對筆數與 Macro F1。
這裡不能只盯著 84%。因為正常簡訊佔 173 / 200,若把全部訊息都判成正常,準確率也有 86.5%。這是依樣本比例計算的簡單基準,說明類別不平衡時,整體準確率可能掩蓋模型對少數類別的處理能力。
原始錯誤也不是完全重疊:29 則只有 Jev 答對,4 則只有 Laya 答對,另外 3 則兩者都錯。這顯示 Jev 在這份樣本上整體較好,但仍有值得回頭檢查的個別案例,不能把任何一方當成永遠正確的裁判。
範例二:Banking77 的 77 選 1,差距為什麼變大?
Banking77 資料集把銀行客服需求拆成 77 個意圖。這組測試的任務,是從所有候選意圖裡直接選出一個。Jev 答對 377 / 462,Laya 答對 183 / 462,Macro F1 也從 Jev 的 0.806 降到 Laya 的 0.346。
候選答案多,不只增加選擇難度,也會消耗描述選項的空間。依官方目前的限制說明,英文 Laya 的選項提示預算 head_max_len 預設為 192 tokens,所有選項必須共享這段空間。當相近的分類名稱與描述被裁短,模型可能失去區分它們的重要文字。
官方提醒,有簡短描述的選項增加到大約 20 個後,就應留意預算與裁切。20 不是所有請求通用的硬性上限,實際影響取決於指令、標籤長度與 checkpoint。77 選 1 已超出建議的使用範圍,因此這個結果同時反映任務難度與目前設定的限制。
分成兩層分類,是可以驗證的改法
一種改法是先把候選答案縮到幾個大類,再在選中的大類裡做細分。以概念示例來說,先分出「卡片」「轉帳」「現金提領」「帳戶」,再於卡片類別中辨認啟用、遺失或付款問題。這樣每一步需要容納的描述較少。
這個策略值得測試,但本文引用的 77 選 1 成績不是兩階段分類的成績。第二層也會受到第一層錯誤影響,所以要評估完整流程的最終分類準確率、兩次呼叫的總延遲,以及無法判斷時的回退方式。不能只拿第一層大類的分數宣稱問題已解決。
Laya 比較快嗎?先分清楚本機等待時間與模型速度
| 任務 | Jev p50 | Laya p50 | Jev p95 | Laya p95 |
|---|
| SMS Spam | 447 ms | 50 ms | 922 ms | 66 ms |
| Banking77 | 432 ms | 294 ms | 658 ms | 354 ms |
同一公開評測的觀察值,單位為毫秒。Jev 經網路呼叫,Laya 在 Apple M3 本機 MPS 執行,不能當成純模型速度比。
p50 是中位數,p95 反映較慢端的等待情況。在這台電腦與這批請求上,Laya 的兩項數值都較低,但差距會隨任務改變。垃圾簡訊的 p50 為 50 毫秒,77 類銀行意圖則上升到 294 毫秒,說明「一次前向運算」不代表任何問題都花相同時間。
更精確地說,銀行客服的原始請求同時包含 77 類 intent 與 10 類 group 兩個獨立問題,所以表中的延遲是整次請求的耗時。這與先取得大類、再縮小選項進行第二次呼叫的分層分類不同,兩者不能混為一談。
這些數字也不能涵蓋首次下載與模型載入。常駐服務可以攤平啟動成本,偶爾才執行一次的工具則可能更在意冷啟動。重新測試時,應把啟動、單筆延遲、批次吞吐量與尖峰等待分開記錄。
本機執行能減少推論時把輸入交給外部服務的需要,但「沒有逐次 API 費用」仍要加上硬體、電力與維護成本。若系統還會使用雲端備援或外部工具,資料流向也要一起看,這與 本機 AI 與雲端分流的取捨有直接關係。
信心值與微調,不能省略的兩個驗收環節
信心值很高,只能描述模型如何分配機率,不能直接當成答案正確的保證。公開評測特別記錄,0.3.11 在 11 個以上選項時會限制溫度,回傳的信心值也未完成相應校準,因此這次沒有拿 77 類任務做可直接比較的信心門檻結論。
如果原本 Jev 設定某個門檻就自動處理,換成 Laya 時不能只保留相同數字。應用自己的已標註資料檢查:門檻提高後,剩下多少案件能自動處理,其中又有多少判錯。選擇門檻的依據,應是可接受的錯誤與覆蓋率。
另一方面,基礎 checkpoint 能直接接受新題目,不等於在任何領域都已經可靠。Laya 官方同時提供微調方向,且承認基礎版在部分工作流測試中表現有限。用自己的領域資料訓練,可能改善結果,但必須留出沒有參與訓練的測試資料。
微調、蒸餾與量化處理的是不同問題。如果要用較強模型產生教學訊號來訓練小模型,可以延伸閱讀 模型蒸餾與本地部署的差異。不能只因為模型變小、能在本機跑,就推論判斷能力等同原服務。
想試 Laya,先從一個可驗收的任務開始
- 先選標準清楚、選項不多的任務,例如把客服單分到幾個部門,並保留其他或資訊不足的處理方式。
- 建立代表真實需求的標註集,涵蓋常見、少見與容易混淆的案例。同時比較簡單規則、Laya 與目前採用的服務。
- 記錄 checkpoint、套件版本、題目文字、選項描述、裝置與推論設定,讓數字可以重現。
- 先找出錯誤集中在哪些分類,再判斷要改題目、縮短選項、分層分類或微調。一次改一個主要因素。
- 把正確率、各類別表現、誤判成本與整條流程的延遲一起驗收,再決定哪些判斷可以自動處理。
如果要重現這次比較,可從 完整評測目錄取得樣本、題目、原始回答與評分程式。只想核對現有數字時,先讀保存的 runs 與 reports 即可。要重跑模型,再依 LAYA.md 的鎖定環境操作,並確認是否沿用了舊結果檔,避免把跳過已完成項目的續跑誤認為新的全量測試。
Laya 與 Jev 常見問題
Laya 可以直接取代 Jev 嗎?
介面相容有助於改接,但不能保證判斷品質相同。在這次 662 筆英文樣本中,Jev 的準確率較高,Laya 的本機延遲較低,是否替換仍需用自己的任務驗收。
Laya 一定要微調才能使用嗎?
基礎 checkpoint 可以直接接受新題目,但可執行不代表準確度足夠。先測原始模型,若錯誤超出需求,再評估題目設計、分層分類或領域微調。
Laya 最多只能選 20 個類別嗎?
約 20 個是官方對預設選項預算的實務提醒,不是固定上限。指令和標籤長度都會影響裁切,候選類別很多時,應檢查預算並測試縮小候選集合的方法。
這次測試能代表 Laya 的中文能力嗎?
不能。受測的是英文基礎 checkpoint 與兩份英文資料集。中文工作應選適合的 checkpoint,另用中文標註資料驗證,不能沿用這裡的準確率。
選擇的依據,是你的任務能不能通過驗收
這次結果支持一個務實的起點:把 Laya 當成可自行部署、值得針對固定任務調整的決策元件。需要大量細分類、又希望直接使用預設設定時,這份測試裡 Jev 的表現較好。先挑一個明確任務做完整驗收,再決定是否替換或混合使用,會比只看「開源平替」四個字更有幫助。
by Rain Chu | 9 月 24, 2026 | Agent, AI
這篇以 Harness Engineering(AI 執行框架工程)為主軸,把工作案例、生活比喻與延伸設想逐項拆開,再補上實作時需要的界線。重點是做出可驗收的工作成果,而不是收集更多工具名稱。
先釐清:改善 Skill、訓練模型與 Harness 是三件事
把作品整理成提示詞、Skill 或知識庫,再用新案例修訂規則,通常是在改善模型外部的工作方式。除非真的執行參數更新,否則不能直接稱為大模型微調。模型能在目前對話參考你的糾正,也不代表它已永久記住,重要規則仍要明確保存。
Harness 的範圍更廣,包含資料入口、工具權限、任務狀態、評估、重試與交接。Anthropic 的長時間應用開發研究示範把規劃、產生與評估拆開,也強調主觀品質需要可判定的標準。不是多放幾份文件就完成整套工程。
實務上先保留三種素材:用來建立規則的示範、用來反覆調整的驗證案例,以及最後才打開的保留測試。scikit-learn 的交叉驗證文件說明了用同一份測試集反覆調整會造成的問題。
從企業導入到日常工具:先證明你解決了問題
1. 微軟派工程團隊進企業(FDE)
每家公司的資料、權限與作業順序不同,買同一套 AI 工具不代表能得到相同成果。這個例子說明,導入工作常常發生在模型之外。
怎麼用:先盤點實際流程與驗收責任。微軟官方公告日期為 7 月 2 日,將 Frontier Company 描述為新的營運事業,並強調與客戶共同設計及持續改善。不要直接寫成所有企業都不該自己做,或把它等同於一間獨立法人公司。
2. Palantir 到情報單位做原型
工程師到客戶現場、展示原型、接受批評再修改,說明需求必須在真實場景裡被看見。
怎麼用:把第一次展示當成收集回饋的工具。Palantir 的 Deployment Strategist 職務說明確實包含深入客戶流程、理解資料及與工程團隊合作,但不能據此替所有故事細節背書。
3. 漂亮網站隔週壞掉
頁面第一次能跑,和日後能維護是不同要求。這個情境包含故障找不到原因、資料管理不清楚,以及錯誤操作破壞網站。
怎麼用:初版完成後就補上備份、可還原版本、關鍵操作驗證與錯誤紀錄。把「看起來正常」改成「主要工作能完成,而且失敗後能恢復」的驗收標準。
4. 遛狗的牽繩比喻
模型可能用不同路徑完成同一件事,牽繩象徵人在必要時能限制或中止行動。比喻要說明的是可控性,不是要求每次輸出逐字一致。
怎麼用:把牽繩具體化成工具權限、可修改範圍、預算與停止條件。只寫一句「不要出錯」,不能代替程式與權限上的控制。
5. 看起來能賣錢的 Skill,直接問模型也能做到
有人投入心力做工具,卻沒有和一般對話比較。關掉工具、交付相同需求後,如果品質差不多,就還沒有證明額外流程的價值。
怎麼用:做基準比較與移除元件的對照測試,固定模型、資料、任務與評分方式,再比較品質、成本及修改時間。
6. 訪綱 Skill
額外 Skill 的差異沒有想像中明顯。這是上一個原則在內容工作中的具體例子。
怎麼用:同一位來賓的背景資料,分別交給直接對話與 Skill,隱去版本名稱後請編輯評估。訪綱要看可追問性與資料正確性,不能只看格式整齊。
7. 模仿 The Diary of a CEO 設計訪談
先用部分訪談建立提問原則,再給未揭露答案的來賓背景,請 AI 設計問題,最後和實際訪談比較。差異可以揭露它是否忽略個人故事、衝突或追問。
怎麼用:拿實際問題當參考,不把原主持人問過的題目視為唯一答案。反覆修訂使用驗證素材,另留從未用來調整的新來賓或新主題,才能檢查原則是否可遷移。
8. 訪綱越像原稿,反而越僵硬
若評分只獎勵字句相似,系統可能把語助詞、段落節奏與固定句型寫死。它會更像舊答案,卻不一定更會訪問新的來賓。
怎麼用:過擬合的重點是新資料上的泛化表現,不是超過某個分數就發生。不要把八成或八成五寫成通用最佳值,也不要故意讓好答案變差以符合比例。資料洩漏與測試集使用原則可作為評估設計的起點。
模型焦慮與工作安排:把限時額度放回任務價值
09. 近期任務、未來版本與系統改善三份清單
把眼前必須交付的工作、未來想做的功能,以及安全、模型切換與 Skill 管理等改善工作分開,能降低新模型推出時不知道該測什麼的混亂。
怎麼用:預先寫好輸入、預期成果及優先順序。比較新模型時使用固定任務清單,才能看出它是否改善真正的瓶頸,而不只是帶來新的待辦事項。
把個人判斷變成可測試的工作規則
10. 寫出自己的文章與影片腳本分身
只請模型歸納過往文風,容易得到泛泛的形容。較有用的做法,是先讓 AI 按相同題目與大綱寫一版,再對照本人完成的版本。
怎麼用:把差異拆成觀點、結構、證據、取捨與措辭,保存能重複使用的規則。文風相似和內容正確要分開評分,避免模仿語氣卻新增未發生的經歷。
11. 巴菲特分身與台積電評論測試
角色提示可以生成像某位投資人的論述,卻不代表知道本人當時有哪些資訊。用實際公開評論比對,也可能遇到模型早已看過答案的污染問題。
怎麼用:把它當分析練習,要求引用公開資料並分開標示事實與推論。歷史評論的相似度不等於投資能力,更不能代表本人對目前個股的建議。
12. 馬斯克分身與創業問題
用名人身分求創業建議,容易把有辨識度的語氣誤認成可靠判斷。真正值得拆解的是成本假設、限制與需要驗證的關鍵條件。
怎麼用:改成要求列出目標、已知事實、不可省略的條件與可測試假說。第一性原理可幫助重新檢查假設,但不是輸入名人名字就會自動成立的能力。
13. 從演講稿找出自己的思考習慣
把多篇演講稿交給 AI,請它辨識常見的論證及決策方式,能把原本不容易說明的思考偏好,變成可討論的候選規則。
怎麼用:要求每個判斷附原文位置,再用另一篇新稿檢查。不要把 AI 歸納的幾個標籤當人格定論,文字只呈現部分情境下的表達。
14. 提問時附選項、建議與可能後果
只把問題丟給主管,會把分析工作一起往上移。附上替代方案與推薦理由,能讓討論直接進入取捨。
怎麼用:先比較可行方案、成本、風險及決策條件。這可以進一步畫成決策樹,但只列三個選項還不是完整決策樹,計算期望值也需要有根據的機率與效益。
15. 董事會報告自動化後,主管的價值在哪裡
把例行報告交給 AI 之後,人的價值可能需要重新說明。但能產生報告,不等於能承擔組織協調、決策與結果責任。
怎麼用:在自動化之前寫清楚省下的時間要投入什麼,以及誰對決策負責。把報告能力和整個職務混為一談,會高估工具的替代範圍。
教育訓練與企業知識:把成果背後的過程留下來
16. NGO 把教材做成志工培訓短片
既有教材拆成較短的知識單元,再接上講稿、配音、簡報、影片與登入觀看流程,目的是降低重複培訓負擔。
怎麼用:先檢查教材內容與學習目標,再製作媒體。聲音複製須取得本人授權,影片也應經內容審查。是否學會要用練習或操作驗收,不能只看播放完畢。
17. Echo 找問題,Delta 快速做原型
討論用兩種角色說明需求洞察和工程實作的互補性:一邊發現不合理之處,一邊快速做出能測試的方案。
怎麼用:讓每個提案同時具備問題證據、可測的改動和使用者回饋。官方職務頁可確認 Echo 與部署策略職務的關聯,但「特種部隊」及人格分類只是訪談的比喻,不是完整招募規則。
18. 中醫師請 AI 反過來挑戰自己的判斷
與其讓 AI 一味附和,這位醫師用它提出不同解釋、追問選擇理由。這個例子強調專業人士的反思過程。
怎麼用:要求反對意見附證據,並區分缺資料、邏輯問題及可考慮的替代解釋。AI 提出的質疑仍可能錯誤,不能直接據此改方或讓一般讀者自行處置病情。
19. PDF 圖表轉成可檢索內容,並留下來源
只抽取文件文字可能漏掉圖片中的座標、單位與圖例。VLM 可以協助閱讀視覺內容,Markdown 則是保存描述的一種格式,兩者不是同一種東西。
怎麼用:同時保留圖表原檔、頁碼、讀出的數值與不確定處。需要計算時優先取得原始表格,別只依賴看圖估值。可延伸看本地 VLM 與文件理解。
20. 資深編輯的價值藏在退稿與修改往返
只有定稿,AI 很難知道編輯刪掉了什麼。作者初稿、編輯意見、作者回稿與最後定案,才顯示修改的理由和界線。
怎麼用:將修改分成事實、結構、讀者理解與風格,整理正反例。新的稿件再測一次,確認它學會判斷原則,而非對每篇文章都套同樣的刪改方式。
21. 課程企劃的 120 個節點為何不能一路直跑
把大型課程專案連成很長的順序,等全部完成才說不對,很難找出最早偏離需求的地方。分段產出、審查與退回,能讓錯誤更早被看見。
怎麼用:節點數不等於必須配置相同數量的 Agent。先按企劃、內容、驗證等成果切段,設定最多修改次數與人工接手條件。Anthropic 的 Agent 設計模式同時包含工作流與評估迭代,線性流程並非一律錯,應依任務需要選擇。多角色安排可參考CrewAI 與多 Agent 工作流。
內容、跑步與遊戲:把好奇心變成可驗證的專案
22. 全聯與 citysuper 超市開箱
兩種超市開箱哪個更受歡迎,不必只靠直覺猜測,可以先查找已發布作品。訪談用它說明觀察市場的方法,沒有提供可核對的比較樣本。
怎麼用:比較發布時間、頻道規模、題材角度及影片形式。搜尋得到的觀看數只能提供需求線索,不能保證你再拍同一主題也有相同流量。
23. 高中生用論文與姿態辨識研究跑姿
先找運動研究,再分析自己的跑步影片,最後提出調整方向,形成文獻、觀察與練習的回饋流程。訪談未提供所用技能包、原始影片或訓練前後紀錄。
怎麼用:技術上,MediaPipe Pose Landmarker可從影像估計人體關鍵點,但關鍵點不等於直接量到力量、傷害風險或完整動力鏈。需在教練指導下核對鏡頭及追蹤誤差,逐步測試調整,有疼痛時先尋求專業評估。
24. 傳說對決重播,找出戰術與技能時機問題
把玩家喜歡的遊戲當學習題目,回看哪個時間點做了什麼選擇,可以練習提出假說與檢查結果。這段不是已完成的產品實測。
怎麼用:請 AI 指出畫面證據、可選動作及判斷的不確定性,再由熟悉遊戲的人確認。理解重播與即時操作是兩種能力,不能把前者直接推成後者。
25. 錄下網站操作,再整理成可重複使用的 Skill
下載文件、移到指定位置等固定操作,可以先示範,再整理輸入、步驟與驗收方式。所核對的官方插件名稱為 Record & Replay,與字幕中的 recall and play 不同。
怎麼用:錄製內容可作為建立技能的素材,但工作流程仍需確認輸入、權限與結果。這不等於能可靠學會任何即時遊戲,也不代表錄一遍便能替孩子自動打完對局。
六個值得留下的觀點,以下為意譯
先定義成果,再選工具
寺廟需要的是可靠的法會系統。程式語言、模型及插件都應服從這個目標。
知道哪裡不好,是把 AI 用好的前提
如果無法判斷品質,就先和領域專家一起建立標準,不能只讓 AI 自己給自己高分。
完成品之外,修改理由也值得保存
編輯與主管真正的判斷,常出現在否決、補證據及改寫的過程。
把大任務拆成能退回的小循環
每段都有產出、檢查與停止條件,出錯時才知道該修哪裡。
先解決身邊可驗證的需求
主管往來及自己的文章,通常比不可求證的名人分身更容易建立回饋。
興趣要接上實作,才會形成能力
跑步和遊戲都能成為專案入口,前提是願意研究、練習、接受證據與修正。
把這些方法用在自己的第一個專案
挑一個你熟悉、會重複發生,而且能檢查對錯的工作。先寫出使用時機、使用者、輸入與成果,再拿現有直接對話作為基準。建立最小版本後,每次只針對清楚的失敗原因修正,保留改版前後的結果。
能被重複利用的不是一句神奇提示詞,而是一組可信資料、清楚規則和可檢查的成果。等小流程穩定,再增加資料來源、角色分工及自動化程度。
需要了解來賓的課程與教學範圍,可參考說明欄提供的AI 超級大腦課官方頁與李佳達頻道。課程宣傳中的效果與比例不作為本文技術查核證據。
常見問題
Harness Engineering 就是微調模型嗎?
不是。它主要設計模型之外的資料、工具、狀態、權限與評估流程。修改提示詞或 Skill 通常不會更新大模型參數。
把資料分兩半,一半反覆測試就夠了嗎?
被用來修正規則的案例已參與開發。若要檢查泛化,還需要未參與調整的保留測試,並避免重複資料與事後資訊洩漏。
AI 準確率超過八成五就叫過擬合嗎?
不是。過擬合應觀察已見案例和新案例的表現差異,不能用固定百分比判定。不同工作也需要不同品質標準。
一百多個流程節點就需要一百多個 Agent 嗎?
不需要。先依成果、相依關係與驗收責任切分工作,再決定是否增加角色。大量 Agent 也會增加協調成本和錯誤來源。
自己的 AI 分身應該收集哪些資料?
除了完成品,還應保留當時的輸入、初稿、修改意見、理由及定稿,並另留新案例驗證。涉及他人或公司的資料,須具備適當使用權限。
by Rain Chu | 9 月 24, 2026 | Agent, AI, 商模
Meta Muse 的吸引力,在於它開始把「幫我想辦法」接到「替我動手做」,例如找二手商品、向賣家議價、整理購物車、聯絡電信客服,都屬於它想接手的生活任務。這也是市場重新評估 Meta AI 業務的一個理由,最近股價狂漲的關係:消費者終於比較容易想像,AI 能替自己省下什麼時間。
Muse 是產品,Muse Spark 是背後的模型
Meta 在 2026 年 9 月 8 日推出 Muse 個人 AI Agent,以對話方式接收任務,搭配自己的雲端電腦與瀏覽器執行操作。它可以在關閉 App 後持續工作,需要你介入時再通知你。
Muse Spark 是模型系列,Muse 則是把模型、工具、記憶與權限控制整合起來的產品。
Meta 在 9 月 2 日發表的 Muse Spark 1.3,重點包括較長的任務流程、多工作切換與指令遵循。
模型表現改善,與每一個網站任務都能成功,仍是不同層次的事。
此外,能使用 Facebook 或 Instagram 連接器,不代表產品會自動讀取你在所有 Meta 服務中的全部資料,實際能取得什麼,仍取決於你連接的服務、核准的權限與資料是否可用。
Muse 可以做到哪些事?先看六類任務
以下把已出現的公開操作案例、官方公布的能力與仍未完成的環節分開整理,判斷 Agent 是否有用,重點不只是它回覆得好不好,而是它交付了什麼結果。
| 任務 | 可代辦的環節 | 仍須確認的結果 |
|---|
| 找商品與議價 | 搜尋刊登、篩選條件、代發訊息、追蹤回覆 | 對方是否答應,以及是否真的成交 |
| 挑衣服與購物 | 依尺寸與場合選品、準備購物車 | 商品、總價、地址與付款核准 |
| 處理帳單 | 比較方案、開啟客服對話、整理下一步 | 能否登入,優惠是否符合資格 |
| 整理社交資訊 | 依條件搜尋可取得的好友資料 | 資料是否完整,名單是否正確 |
| 追蹤長期目標 | 記住需求、持續追蹤、適時提醒 | 任務是否持續有效,通知是否有用 |
| 行政與內容產出 | 信件、行程、表單、文件與互動頁面 | 寄送、預訂和交付內容是否通過檢查 |
一、Facebook Marketplace:找得到,也能代你開口談
以尋找 iPhone 為例,任務包含地區、品牌與可接受價格,Muse 不只提供搜尋建議,還能整理候選商品,準備議價訊息,經確認後送出,再持續追蹤賣家回覆。
這類工作最耗人的地方,往往是反覆搜尋、比較與等待。交給 Agent 的價值,是把多個零碎步驟串起來。只是「訊息已送出」與「已用理想價格買到」必須分開,公開案例尚不足以證明最後成交或實際省下多少錢。
如果要委託這種任務,條件可以寫得更具體:限可面交地區、指定品牌與容量、最高預算、可接受的商品狀況,以及超出預算時是否必須回報。談價的目標與能承諾的範圍愈清楚,愈容易檢查結果。
二、Facebook 好友整理:
把多年沒聯絡好友找出來,是一個很貼近 Meta 社交背景的需求.
這項案例比較適合用來理解任務方向,還不能作為「能準確重建社交圈」的結論。實際使用時,應要求列出判斷依據與不確定的項目,再由本人決定是否聯絡。
三、長期目標:把一次指令變成持續追蹤
Muse 的另一個方向,是記住你正在處理什麼。買 ㄞiPhone 不必等同一次聊天,還可以成為待追蹤的目標。賣家晚些回覆、條件改變,或需要你決定下一步時,再把資訊帶回來。
官方產品設計說明把這種能力放進 Goals、活動紀錄與記憶管理,讓任務可以依排程或事件繼續推進。對使用者而言,真正該驗收的是「有沒有在需要時帶回新結果」,而非訊息數量多不多。
手機使用時間、學習進度或運動計畫,也能成為對話與追蹤的題目。但提出計畫不等於目標已達成。健康與財務類建議,更需要核對原始資料,不能因為連接了帳戶,就假定分析一定正確。
四、行政與文件:不只回一段文字,也能產出成果
官方公布的用途還包含處理信件、旅行安排與填表。產品設計文件也列出文件、PDF、網頁及互動式追蹤工具等輸出。
這和 讓 AI Agent 操作 Office 文件談的是相近的需求:使用者需要能打開、修改與檢查的成果,而不只是聊天中的一段建議,不同 Agent 的工具、檔案支援與權限仍各有差異。
安全設計怎麼看?付款核准與資料隔離要分清楚
依 Meta 的Muse 安全架構說明,Muse 在獨立雲端環境中工作,外部操作由另一套 Sentinel 權限系統把關。密碼與付款憑證透過隔離儲存供工具使用,主要 Agent 不直接看到原始憑證。
Muse 可以協助購物,但購買時需要使用者核准具體交易內容。應透過產品提供的登入與錢包介面授權,不能把密碼或信用卡號直接貼進聊天,當成安全儲存的替代方式。
官方表示,對話與 VM 資料不直接提供給 Meta 廣告系統,模型訓練使用另有退出設定。現行 Secure VM 並非讓 Meta 在技術上完全無法存取資料,進一步的 Confidential VM 在發表時仍列為後續計畫。
若你在意資料留在哪裡,可以對照本機優先 Agent 與雲端服務的差異。雲端隔離環境和本機部署,解決的問題並不完全相同。對生活助理而言,方便程度也往往和你願意授權的範圍一起增加。
Meta 股價最近為什麼大漲?先把日期對齊
這一波最醒目的變動出現在美東時間 2026 年 9 月 21 日。Meta 收盤價由前一交易日的 665.75 美元升至 741.25 美元,依這兩個未調整收盤價計算,上漲約 11.34%。9 月 22 日則收在 736.60 美元,較前一日回落約 0.63%。
| 美東交易日期 | 收盤價(美元) | 與前一列收盤價相比 |
|---|
| 2026-09-18 | 665.75 | 比較基準 |
| 2026-09-21 | 741.25 | +11.34% |
| 2026-09-22 | 736.60 | −0.63% |
市場重新評價的,是 AI 能否成為大眾產品
依 Yahoo Finance 的 9 月 21 日報導,當日的催化因素包含 Muse 在美國 App Store 免費榜的表現,以及 Wells Fargo 上調 Meta 目標價。報導同時提到,市場正關注即將到來的 Meta Connect。這些因素同時出現,不能把全部漲幅單獨歸因於某一個功能。
我的解讀是,Muse 讓市場比較容易看見 AI 投入與消費者需求之間的連結。模型跑分離多數人的生活很遠,但替人查帳單、找便宜商品、處理行政瑣事,價值更容易被理解。
Meta 的機會,在於它既有的消費者產品與使用習慣。如果個人助理能在熟悉的介面裡完成有用的事,就可能降低嘗試門檻。不過,下載榜名次不是長期活躍人數,更不是付費率或獲利能力的證明。
想試 Muse,先交付一件可驗收的小事
官方公開發表資訊仍以美國推出為主,可從Muse 官方入口確認自己帳號的可用狀態、方案與額度。
開始時,可以沿用先釐清 Agent 任務需求的做法,把目標、限制與交付結果一起說清楚。例如:「找出本週可面交的指定品牌商品,整理價格與狀況,先不要聯絡賣家。」確認資訊品質後,再決定是否交付議價或後續追蹤。
Muse 值得關注的地方,是把生活中的搜尋、判斷、操作與追蹤接得更完整。它能否成為長期使用的個人助理,要看這些日常小事能否反覆做對。Meta 股價已反映一部分期待,接下來還需要使用者留存、服務可靠度與商業成果接棒。
Muse 與 Meta 股價常見問題
Meta Muse 和 Muse Spark 有什麼不同?
Muse 是面向使用者的個人 AI Agent 產品,Muse Spark 是背後的模型系列。實際任務還需要瀏覽器、工具、記憶與權限控制配合。
Muse 可以自行刷卡購物嗎?
它能準備購物流程,但官方設計要求在購買時核准具體交易。憑證應透過專用登入與錢包介面處理,不應直接貼進對話。
台灣現在能使用 Muse 嗎?
截至 2026 年 9 月 23 日核對,官方發表資訊仍以美國推出為主。台灣是否開放、帳號是否符合資格,需以官方入口與帳號顯示為準。
by Rain Chu | 9 月 20, 2026 | Agent, AI
當工作需要反覆讀取私人文件、呼叫工具,或同時執行多個任務,模型之外的資料流向、硬體安排與執行框架,也會影響實際成果。
DSH Privacy Router、NVIDIA PAIR、EXO 與 Perplexity Portable Computer,分別處理隱私分流、區網排程、模型分散運算與完整 Agent 工作流程。
本機 AI 先看三件事:資料、容量與工作流程
第一件事是資料能不能外傳。即使雲端模型能力更強,有些內容仍應留在自己的設備或信任的內部網路。
第二件事是硬體能不能容納模型,以及能否在可接受的時間內完成工作。
第三件事是模型以外的操作,像讀檔、搜尋、驗證與產出文件,有沒有完整流程。
這些問題需要分別處理。推論引擎負責執行模型,Agent 框架負責組織工具與任務,路由器則決定請求送到哪裡。
還不熟悉這些層次,可以先看 本地大模型推論框架比較,再判斷自己缺的是哪一層。
DSH Privacy Router:先判斷哪些內容能送雲端
DSH Privacy Router 是 DeepSeek Harness 的 Host 端插件。
它先用本機規則與模型檢查文字,分類為 public、sensitive 或 unknown。
只有通過公開分類的請求才送雲端,敏感或不確定的內容留在本機。
這是隱私導向的分流,不是單純把困難問題全部轉給大模型。
預設雲端上下文只包含本輪通過檢查的純文字、固定系統提示與空工具清單。
專案文件說明,私有對話與本機工具結果不會直接附帶過去,雲端回答則直接串流回目前對話,不由本機模型再次改寫,開啟特定相容事件功能後,才可納入先前已核准的雲端對話。
公開程式可看到兩個關鍵控制:雲端分支只在分類結果為 public 時啟用,真正送出時會重新組合訊息,並把工具列表設為空。這比只在提示詞寫「不要洩漏資料」多了程式層的限制。不過,這仍不代表整個應用的所有網路流量都受到同一個插件管理。核對版本見 DSH 路由程式。
導入前要知道,這個公開儲存庫不包含展示用 Web UI 或 DSH 原始碼補丁。
README 的介面展示屬於構想,不能把安裝插件理解成會立即得到完整視覺介面。
先依文件設定可信任的本機 Provider,再確認實際連到的服務確實位於可信任環境。
自動發現本機算力,不等於自動信任任何設備
配套的 Local AI Discovery Server 用 mDNS/DNS-SD 宣告區域網路中的 OpenAI 相容 API,提供主機、連接埠、模型清單位置與認證需求等資訊。
它負責讓服務被找到,本身不執行模型,也不是 API 代理。DSH 端仍需要對應的發現整合。
發現服務與信任服務是不同步驟,在家中看得到的端點,不代表公司文件就適合送過去,更不用說共享空間的陌生設備。
評估時應確認設備由誰管理、是否使用認證,以及請求最後送往哪個端點。服務名稱帶有「local」,不能取代這些確認。
NVIDIA PAIR:把獨立請求分配給區網內的電腦
NVIDIA Personal AI Router,也就是 PAIR 目前以測試版提供本機推論路由,支援相容的 Windows、Linux、macOS 系統,搭配 Ollama 與 LM Studio。它的目標是讓應用使用單一入口,把多個推論請求分配給可用設備。
PAIR 不會把多台電腦的顯示記憶體合成一個大空間,也不會把同一個推論請求拆到多台執行。每個請求會交給一個符合條件的節點,該節點負責執行到結束。
當多個 Agent 同時提出獨立請求時,其他設備才有機會分擔排隊壓力。
官方技術文件說明,排程會考慮節點是否在線、推論引擎是否可用、是否有指定模型,以及目前負載。節點經過配對後,通訊使用相互 TLS 驗證與加密。
這解決的是信任節點之間的推論傳輸,不能延伸成 Agent 使用任何搜尋或外部工具都不會外傳資料。詳見 NVIDIA PAIR 技術說明。
若工作主要是一個接著一個的長推論,或只有一台設備裝了需要的模型,多加節點的效益可能有限。評估時要看整個任務完成時間,以及 Jobs 紀錄是否真的顯示不同節點處理請求,而不只看畫面上出現幾個 Agent。
EXO:把模型拆到多台設備,與 PAIR 的用途不同
EXO 的核心包含模型分片與分散推論,會考慮裝置資源及網路拓樸,讓單一設備放不下的模型有機會跨設備執行。README 介紹了 MLX、張量平行與 Thunderbolt RDMA 等能力,這和 PAIR 分派完整請求的做法不同。
分散推論需要設備交換資料,速度取決於模型、切分方式與實際互連。
能容納更大模型,不代表每次回答一定更快,也不能直接把各台硬體的標示效能相加,想理解雙機部署的取捨,可延伸閱讀 雙機本地模型部署與實測整理,並分開看容量與速度。
截至 2026 年 9 月 14 日核對,EXO 的 平台支援文件 把 Apple Silicon macOS 列為已測試與維護的主要平台,Linux CUDA 與 DGX Spark 則仍列在規劃區。
Portable Computer:把本機模型接成完整 Agent
Perplexity Portable Computer 的定位是本機優先的 Agent 軟體,不是一款 Perplexity 品牌硬體。
官方發表資料以 DGX Spark 為首波設備,將模型、執行框架與工作紀錄放在本機,必要時再經授權使用搜尋、連接器或雲端模型。
平台支援與訂閱資格會更新,安裝前應重新確認產品入口。
比起單純啟動模型,它更重視框架如何配合本機模型的能力:
縮小核心工具集合、按需載入 Skills、整理過長上下文,以及加入結果驗證。官方研究也說明,工具執行受作業系統層的沙箱限制,沙箱不可用時不退回無隔離執行。參考 Perplexity 的本機優先 Agent 研究。
雲端顧問只接收核准的上下文並回傳文字建議,沒有直接操作本機檔案與工具的權限。是否開啟顧問,以及採手動或自動核准,由使用者設定,「本機優先」仍須搭配實際的連外與核准政策來理解。
中文導讀也可參考 AI 郵報 Portable Computer 整理。其中的硬體需求、測試分數與上市資訊,應回到對應官方文件與測試條件核對,不宜直接推論成所有任務的表現。
四個方案怎麼分?先對照自己要解的問題
| 方案 | 主要處理的問題 | 不能直接推論的能力 |
|---|
| DSH Privacy Router | 判斷文字是否可送雲端並限制上下文 | 不能保證分類永遠正確或涵蓋所有資料出口 |
| NVIDIA PAIR | 把獨立推論請求分配到可用的區網節點 | 不合併顯示記憶體,也不切分單一推論請求 |
| EXO | 跨設備切分模型與分散推論 | 不代表任意平台組合都已支援或一定加速 |
| Portable Computer | 整合本機模型、工具、沙箱與授權連外 | 本機優先不代表開啟外部服務後仍完全離線 |
這張表依前述官方文件整理的是功能範圍,不是效能排名。若想組合使用,還要核對 API、模型格式、端點與執行框架是否相容,不能假設名稱都和本機 AI 有關就能直接串接。
隱私真正難的地方,是內容看起來不敏感
沒有姓名、電話或金鑰,不代表內容可以公開。
例如尚未發表的產品構想、內部定價方法或獨特研究策略,就算去掉身分資訊,仍可能包含不應外傳的價值,這是自動隱私分類需要面對的限制,不能只用是否偵測到個資判斷。
DSH 用規則加模型檢查,Portable Computer 也描述了分類器與核准機制,但分類器仍可能漏判。
對不可外傳的工作,應有明確的本機限定設定,以及實際阻止連外的權限或網路政策。對允許求助雲端的工作,則要看清楚送出的片段、歷史上下文與工具結果。
驗收可以從幾種情境開始:一般公開問題、含機密的文件、依賴前文的「繼續」、分類失敗,以及雲端要求呼叫工具。
確認它們分別送去哪裡、留下什麼紀錄,並能追查答案由哪個模型產生。不要為了觀察系統又把完整機密複製進不受控的日誌。
開始之前,先用現有設備跑完一個真實任務
先挑一個可驗證的小工作,例如整理不含機密的測試文件,用現有設備與合適模型完成一次。若問題是模型服務與應用怎麼接,可以先參考 LibreChat 與 Ollama 的串接方式,等單機流程穩定,再處理分流與多機。
接著辨認瓶頸。獨立請求很多、都擠在同一台,才評估 PAIR。模型放不下,才研究 EXO 等分散推論路線。
需要選擇哪些內容送雲端,再檢查 DSH 的分流設計。想降低工具、沙箱與任務流程的整合工作,則可評估 Portable Computer。
本機推論能減少按量 API 費用,但仍有硬體、電力、維護與等待時間。選擇性使用雲端,也可能產生額外用量。
先量出自己的任務品質與完成時間,再決定是否擴充設備,會比從硬體規格開始更容易做出合適選擇。
本機 AI 路由常見問題
DSH Privacy Router 會把困難問題自動交給雲端嗎?
它主要依隱私分類分流,只有判定為 public 的請求才走雲端。敏感、不確定或無法分類的內容留在本機,不能視為單純依難度切換模型。
NVIDIA PAIR 能把多台電腦合成一張大顯卡嗎?
不能。PAIR 將獨立推論請求分派給符合條件的單一節點,不合併顯示記憶體,也不把一個請求切到多台電腦執行。
EXO 和 PAIR 差在哪裡?
EXO 包含跨設備模型分片與分散推論能力,PAIR 則分派完整的獨立請求。選擇前要先分清楚瓶頸是模型容量,還是同時有太多請求排隊。
Portable Computer 等於完全離線嗎?
不一定。核心工作預設在本機,搜尋、連接器與雲端顧問則可能連外。是否外傳資料,取決於開啟的功能、授權設定與實際送出的上下文。
近期留言