Select Page
ChatGPT Work 是什麼?Codex 與 GPT-5.6 正式合體成 AI 代理

ChatGPT Work 是什麼?Codex 與 GPT-5.6 正式合體成 AI 代理

ChatGPT Work 的重點,不只是 OpenAI 又多了一個模式,而是 Codex 的 Agent 執行能力正式被放進 ChatGPT 裡,並由 GPT-5.6 Sol、Terra、Luna 三個模型層級支撐起來。

這代表 ChatGPT 正在從「聊天視窗」變成「能跨檔案、跨應用程式、跨瀏覽器、跨團隊工具做事的 AI 代理」,以前 Codex 比較像工程師工具,現在它的能力被包進一般知識工作者也能理解的 Work 模式裡,這一步很關鍵。

我會把這次更新理解成三件事:

第一,Codex 不再只是寫程式,而是成為 ChatGPT 的行動層

第二,GPT-5.6 把模型能力分成 Sol、Terra、Luna,讓不同成本和任務有不同選擇

第三,Sites、桌面 App、外掛目錄、Ultra 多 Agent 模式,正在把「讓 AI 完成工作」這件事產品化。

而且不用再多開多個 APP 了

先講結論:ChatGPT Work 是 Codex 走向全民化的形態

以前談 Codex,直覺會想到寫程式、改 repo、跑測試、開 PR,這次 ChatGPT Work 的定位不同,它不是只服務開發者,而是把 Codex 那套長任務執行能力拿去處理一般工作:分析 Excel、整理資料夾、生成簡報、建立互動式網站、讀 Slack 或 Gmail、把結果發回團隊工具。

這也解釋了為什麼 OpenAI 要把 Chat、Work、Codex 放在同一個桌面應用程式裡。

Chat 負責快速問答,Work 負責長任務,Codex 負責更深的開發與工具執行。對使用者來說,不需要再思考「我現在要開哪個產品」,而是直接把任務丟進同一個工作入口。

站上之前整理過 從 Claude Code、Codex、Hermes 到 nuwa-skill 的 AI 工作流,那時 Codex 還比較偏工程場景;ChatGPT Work 則是把這條路推向更大的辦公場景。

GPT-5.6 三層模型:Sol、Terra、Luna 各自負責不同工作

這次 GPT-5.6 不再只是單一模型名稱,而是拆成三個層級。

模型定位適合場景
Sol旗艦模型高難度 Agent 任務、程式碼、設計判斷、複雜知識工作
Terra日常均衡模型一般工作流、文件分析、較高頻的辦公任務
Luna快速低成本模型大量處理、成本敏感、速度優先的任務

這個分層很務實。不是每個任務都需要 Sol,也不是每個人都該用最高推理檔。真正成熟的 AI 工作流,應該是把最貴的模型留給最難的決策,把便宜快速的模型用在大量例行工作。

參考資料裡提到的定價方向也很清楚:

Sol 最貴,Terra 居中,Luna 最便宜。這代表未來使用 ChatGPT Work 時,模型選擇會變成工作流設計的一部分,而不只是「選最強」。

Ultra 模式:不是一個模型想更久,而是一組 Agent 並行

Ultra 模式很值得注意。它不是單純把同一個模型推理時間拉長,而是讓多個 Agent 平行工作,再把結果整合起來,這和過去「一個模型慢慢想」的概念不同,更接近一個小團隊同時拆任務。

這種設計特別適合長任務:研究、寫報告、建立網站、跑程式、做多版本比較、測試不同方向,當任務可以拆成多條路並行時,Ultra 的價值才會出來。

但它也帶來現實問題:用量會變大。實測留言裡有人提到 Work 模式會快速消耗額度,這點很合理。多 Agent 並行不是免費加速,它本質上就是用更多 token、更多運算,換更高成功率或更短等待時間。

ChatGPT Work 可以做什麼?重點是「交付成果」

ChatGPT Work 最重要的變化,是它不只回答問題,而是直接交付成果,官方展示裡出現幾個很典型的辦公場景:讀 Slack 和員工回饋、找出適合訪談的人、安排會議;分析財務模型、更新 Excel、生成 PowerPoint;把分析結果做成可分享的互動網站。

這些任務的共同點是:它們不是一句問答,而是需要跨多個資料源、跨多個步驟、最後輸出一個可用成品,這就是 Codex 能力進入 ChatGPT 的意義,Codex 原本擅長把目標拆成步驟、執行工具、檢查結果,Work 則把這套能力包成知識工作者能用的產品介面。

如果你想把這類長任務做得更穩,前置需求釐清仍然很重要,我會把 Grill Me 需求訪談工作流 放在 ChatGPT Work 前面用:先問清楚目標、限制、輸出格式和驗收標準,再讓 Work 開始執行。

桌面 App 是關鍵:本機檔案、瀏覽器分頁、其他 App 都進來了

新的 ChatGPT 桌面 App 是這次更新裡非常關鍵的一塊。它不只是把網頁版包成桌面視窗,而是讓 ChatGPT 可以碰到本機檔案、瀏覽器分頁,甚至其他應用程式。

這代表一個很大的轉折:AI 不再只讀你貼進對話框的內容,而是能在你授權的範圍內,直接理解桌面上的工作現場。資料夾裡的 PDF、Chrome 分頁裡的背景資料、Apple Notes 裡的凌亂筆記、試算表裡的回饋資料,都可以成為任務上下文。

這和 OpenWork / OpenCode 桌面工作台 的方向其實相通:AI Agent 最後一定會往「讀得到你的工作環境、操作得到工具、交付得了成品」這條路走。

Sites:從報告變成可分享的互動工具

Sites 是另一個我覺得很重要的功能。過去 AI 幫你整理資料,多半輸出一段文字、一個表格或一份簡報,Sites 則是把結果變成互動網站、內部工具、儀表板或原型。

這會改變「交付物」的想像。財務分析不一定只能是一份 PowerPoint,也可以是可互動的 dashboard,產品規劃不一定只能是一份文件,也可以是可點擊的 prototype;資料整理不一定只是摘要,也可以變成團隊能共同查看的網站。

這裡也可以接回站上之前整理過的 AISA 一個 API Key 連上多種資源。未來真正有價值的不是單一模型,而是模型、資料源、外掛、網站部署和團隊協作工具串在一起的工作流。

外掛目錄回來了,但這次不是 2023 年那種玩具感

這次新的統一外掛程式目錄,包含 Google Drive、SharePoint、Slack、Microsoft Teams、Gmail、Outlook、Salesforce、Adobe、Zoom、LinkedIn、GitHub、Canva、Dropbox 等整合。這很像 2023 年 ChatGPT Plugins 的第二次機會,但底層條件已經不同。

2023 年的外掛比較像「讓聊天機器人查外部資料」。這一次的外掛更接近「讓 Agent 取得任務所需的工作上下文」。當模型具備長任務執行能力,外掛就不是裝飾,而是資料入口、工具入口和交付入口。

也就是說,外掛目錄真正的價值,不是多支援幾個品牌,而是讓 ChatGPT Work 可以在你的工作系統中移動:讀資料、做分析、產出文件、發送結果、更新工具。

實測很強,但不能神化:耗時、額度、細節錯誤仍然存在

NiceKate AI 的實測很有參考價值,因為它不是只看官方展示,而是拿 GPT-5.6 Sol 跑圖片辨識、PPT、Excel、網頁設計、Image to Code、3D 建模、Android App UI 審查、macOS App 開發和短片生成。

好的部分很明顯:頁面設計質感比前代更好,能做更完整的互動式視覺化,能把圖片轉成可互動網頁,能操作 Android 裝置截圖做 UI 審查,也能在 macOS App 開發中自行遇到錯誤再修正。

但限制也很清楚:有些任務會跑 19 分鐘、30 分鐘、甚至 40 分鐘,複雜 3D、交通仿真、精密還原仍會出現結構錯誤,Work / Codex 模式會明顯消耗額度,這不是「按一下就完美交付」的魔法,而是「可以把更多長任務交給 Agent,但你要學會規格、驗收和成本控管」。

模型能力對很多人來說可能已經過剩,真正重要的是在實際場景裡能解決什麼問題。這句話很適合放在 ChatGPT Work 上。不要只測模型會不會做炫技 demo,要問它能不能幫你穩定完成週報、資料整理、客戶研究、網站原型、財務分析、App 審查這些真任務。

安全與權限:Agent 能做事後,風險也變具體了

當 ChatGPT Work 可以讀檔案、看瀏覽器、操作 App、存取 Slack / Gmail / Drive,安全問題就不再是抽象討論。它能做越多,越需要清楚的權限、審查和用量控管。

參考資料提到 Auto-Review、安全監控、紅隊測試、依風險調整存取權限,以及 Enterprise / Edu 管理員可以做 spend controls。這些功能不是企業才需要,一般使用者也要養成習慣:不要一次授權太多資料,不要讓 Agent 直接做不可逆操作,重要輸出要驗證。

這也是為什麼我一直覺得 Agent 工作流需要紀律,你可以參考 Grill Me 的思路:先讓 AI 問清楚,再讓它執行,重要任務要有驗收清單;涉及資料、金錢、客戶、程式部署時,要保留人工確認點。

這對使用者代表什麼?

我覺得 ChatGPT Work 會讓三種人最先有感。

  • 知識工作者:可以把研究、整理、簡報、試算表、網站原型交給 Work 做第一版,再由人驗收。
  • 開發者與產品團隊:Codex 能力整合進 ChatGPT 後,從需求、原型、程式、測試到部署的距離會縮短。
  • 一人公司與內容創作者:可以把資料蒐集、腳本、視覺化、網站、短片和社群素材變成一條工作流。

但這也會拉開差距。會下任務、會拆規格、會驗收、會控制成本的人,會把 ChatGPT Work 用得像小團隊,只會丟一句「幫我做一下」的人,可能只會得到昂貴又不穩的半成品。

我會怎麼開始用?

如果現在要開始測 ChatGPT Work,我會先從低風險但有價值的任務開始。

  • 整理一個資料夾裡的 PDF、簡報和筆記,產出一份會議簡報。
  • 讀一份 Excel 或 CSV,產出互動式 dashboard 和重點摘要。
  • 把產品想法做成可點擊網站原型,再請它列出待驗證假設。
  • 讓 Codex 檢查一個小型 repo,先產生修改計畫,不要直接改。
  • 把 Slack / Gmail / Drive 這類外掛逐步接入,不要一開始全開。

如果你想比較本地 Agent 工作台和雲端 Work 模式的差異,可以接著看 OpenWork / OpenCode 桌面工作台。雲端 Work 勝在整合和模型能力,本地工具則勝在可控、可自訂和成本安排。

結論:ChatGPT Work 是「AI 代理辦公」的分水嶺

ChatGPT Work 不是單純的新功能,而是 OpenAI 把 Codex、GPT-5.6、桌面 App、外掛、Sites、多 Agent 模式合在一起後,給一般使用者的一個新工作入口。

它最重要的意義是:AI 不再只是回答你的問題,而是開始接近「拿到目標後,跨工具完成工作」,這也是 AI Agent 真正從開發者圈走向辦公室、團隊、內容創作和一人公司的關鍵一步。

但越是這樣,越要記得兩件事:第一,強模型不等於免驗收;第二,長任務不等於低成本。未來真正重要的能力,不只是會用 GPT-5.6,而是會把任務設計成 AI 能完成、人能驗收、成本能控制的工作流。

延伸資源

FAQ

ChatGPT Work 是什麼?

ChatGPT Work 是 OpenAI 把 Codex 的 Agent 執行能力整合進 ChatGPT 後推出的工作模式,目標是處理比一般聊天更長、更複雜、需要跨工具完成的任務。

GPT-5.6 Sol、Terra、Luna 差在哪?

Sol 是旗艦模型,適合高難度 Agent 任務;Terra 是日常均衡模型;Luna 則主打速度和低成本,適合大量處理。

ChatGPT Work 和 Codex 是什麼關係?

Codex 提供長任務執行、工具操作和開發相關能力;ChatGPT Work 則把這些能力包進一般使用者能操作的 ChatGPT 工作介面。

Lumi AI 是什麼?用聊天就能完成網站的 AI 建站工具介紹

Lumi AI 是什麼?用聊天就能完成網站的 AI 建站工具介紹

以前建立一個網站往往代表著學寫程式、研究版型、反覆修改設計,對許多人來說門檻相當高。但現在,隨著 AI 技術成熟,網站製作正快速走向「對話化」。
Lumi AI 主打一個簡單卻強大的理念:你只需要與 AI 聊天,就能將腦中的想法,變成一個優雅且可行的網站。


什麼是 Lumi AI?

Lumi AI 是一款 AI 驅動的網站建立工具,使用者不需要任何設計或程式背景,只要透過對話方式,描述你的想法,例如:

  • 「我想要一個新創公司形象網站」
  • 「幫我做一個產品介紹頁,有現代感與科技風」
  • 「我需要一個個人作品集網站」

Lumi 會根據你的描述,即時產生網站結構、版型與內容,讓「想法 → 網站」的距離縮短到幾分鐘。


Lumi AI 的核心特色

1️⃣ 與 AI 聊天,就能建立網站

Lumi 最大的特色在於對話式體驗。你不需要面對複雜的後台設定,只要像聊天一樣說出需求,AI 就會一步步幫你完成網站雛形。

2️⃣ 將創意快速轉化為可行網站

從概念、版型到內容呈現,Lumi AI 會自動整合設計與結構,產生一個真正可以使用的網站,而不是只有概念草稿。

3️⃣ 優雅、現代的視覺設計

Lumi 預設產出的網站風格簡潔、現代,特別適合新創團隊、產品頁面、個人品牌與展示型網站。

4️⃣ No-Code,任何人都能上手

不論你是設計師、創業者、行銷人員,甚至是 Data Analyst,只要能清楚描述需求,就能用 Lumi AI 建立網站,完全不需要寫程式。


Lumi AI 與 Data AI、Data Analyst 的關聯

你可能會好奇,Lumi AI 和 Data AI、Data Analyst 有什麼關係?

實際上,Lumi AI 非常適合用來:

  • 建立 資料分析成果展示網站
  • 製作 Data Analyst 個人作品集(Portfolio)
  • 快速生成 數據產品或 AI 專案的介紹頁

對 Data Analyst 而言,Lumi AI 能大幅降低「展示分析成果」的門檻,讓重點回到資料洞察本身,而非網站技術細節


Lumi AI 適合哪些人使用?

  • 🚀 新創團隊:快速驗證想法,建立產品或服務頁
  • 🎨 設計與行銷人員:用對話完成網站初稿
  • 📊 Data Analyst / Data AI 專案負責人:展示分析成果與案例
  • 🧑‍💻 個人品牌經營者:建立個人網站或作品集

官方網站

👉 https://lumi.new/zh-TW

Data Analyst 必看:Julius AI 如何用自然語言顛覆資料分析

Data Analyst 必看:Julius AI 如何用自然語言顛覆資料分析

Data Analyst(資料分析師)與企業決策者每天都要面對大量數據,但不是每個人都具備寫程式、操作複雜分析工具的能力。這正是 Julius AI 誕生的原因——讓你不用寫程式,只要用英文問問題,就能在幾秒鐘內獲得洞察


什麼是 Julius AI?

Julius AI 是一款以 Data AI 為核心的智慧資料分析平台。使用者只需上傳資料(例如 CSV、Excel、Google Sheets),就可以像聊天一樣,用自然語言詢問問題:

  • 「哪一個產品的成長率最高?」
  • 「請幫我畫出近三年的營收趨勢圖」
  • 「這份資料中有沒有異常值?」

Julius AI 會即時理解你的問題,並自動完成分析、計算與視覺化,讓資料真正「開口說話」。


Julius AI 的核心特色

1️⃣ 連接你的資料,立刻開始分析

Julius AI 支援多種常見資料格式,無論是試算表還是資料表,都能快速上傳並使用,完全不需要事前建模或設定複雜流程。

2️⃣ 用白話英文提問,不需要寫程式

最大的亮點在於 No Coding Required。你不必懂 Python、SQL 或 R,只要用英文描述你的需求,Julius AI 就能自動完成背後的資料分析邏輯。

3️⃣ 幾秒鐘內產生洞察與圖表

從資料清理、分析到圖表生成,Julius AI 幾乎都是即時完成,非常適合需要快速決策的商業場景。

4️⃣ 為 Data Analyst 與非技術人員量身打造

不論你是專業的 Data Analyst,還是行銷、產品、營運人員,Julius AI 都能降低資料分析門檻,讓更多人能參與數據決策。


Julius AI 可以用在哪些情境?

  • 📊 商業決策分析:快速找出銷售趨勢與關鍵指標
  • 📈 行銷成效評估:分析活動轉換率與使用者行為
  • 🧠 教育與研究:協助學生與研究人員理解資料結構
  • 🏢 新創與中小企業:沒有專屬 Data Team 也能做專業分析

為什麼 Julius AI 值得關注?

在過去,資料分析往往意味著「高技術門檻」與「長時間準備」。Julius AI 將 Data AI 與自然語言處理結合,讓資料分析變得更直覺、更民主化。
對 Data Analyst 來說,它能加快工作流程;對非技術背景的使用者來說,則是一條直接進入數據世界的捷徑。


官方網站

👉 https://julius.ai/

「從零開始:如何用 ChatArt 免費生成小說與插圖」

「從零開始:如何用 ChatArt 免費生成小說與插圖」

ChatArt 是一款整合 AI 聊天、寫作、繪圖的工具平台。它支援用戶用對話方式輸入想法、選擇創作場景,平台便會協助產出文章、小說,甚至圖片。根據官網介紹,它提供小說產生器、圖生圖、文生圖功能,並且多平台支援(網頁/手機/平板)

為什麼用 AI 來寫小說、畫圖?

  1. 激發創意、打破瓶頸
    許多人在寫作或畫圖時會卡關:構思難、敘事斷裂、視覺想像模糊。透過 AI ,您可以輸入關鍵字:「奇幻世界、機器人女孩、秋天森林」… AI 即刻幫您延展敘事、生成畫面。這種「腦力解放」讓創作更順暢。
  2. 節省時間、提高效率
    傳統手寫小說或手繪畫圖,從無到有需花很多時間構思、草稿、修正。利用 AI 工具,許多初稿可迅速生成,您再進行潤飾即可,大幅縮短創作週期。
  3. 視覺與文字一體化
    在 ChatArt 中,您不只寫小說,也能同步產出畫圖(如「文生圖」)。這意味著:「我寫一段場景 → AI 畫一幅配圖」成為可能,增強作品整體感。
  4. 免費/低成本起步
    雖然有付費方案,但 ChatArt 提供免費試用或低門檻方案,適合創作者先探索、建立習慣,再決定是否升級。這對想先試水溫的用戶友善。

如何用 ChatArt 來寫小說+畫圖 — 步驟指南

以下為建議流程,協助您快速上手:

1. 明確構思主題
先決定小說主題/畫圖場景。例:「未來城市中的漂浮圖書館」、「中世紀魔法少女與龍的故事」。這能作為 AI 輸入提示。

2. 開啟小說產生器
在 ChatArt 選擇「小說產生器」或「寫作助手」,輸入您的主題、角色、設定(例如:主角、世界觀、衝突)。平台便會生成一段文字。您可以修改、擴充或重新生成。

3. 產出畫圖
將小說中的一幕(例如:主角站在漂浮圖書館的陽臺)輸入「文生圖」功能,讓 AI 依您描述生成對應畫面。此外,也可使用「圖生圖」將已有圖片轉為不同風格。這樣小說與畫圖同步,視覺+文字雙軌。

4. 潤飾與整合
由 AI 產出的內容通常為草稿級,可依您的風格調整文字、修正畫面細節。此階段可加入對話、細節描寫、畫圖色調風格等。

5. 發佈與迭代
完成後,您可在部落格或社群上發佈,若讀者反饋良好,還可將這個作品延伸成系列。每次都可回到 ChatArt 進行新章節/新畫面創作。


創意應用案例

  • 短篇小說+插圖集:用 ChatArt 快速創作一篇短篇(如 1000 字內)+ 3~5 張配圖,製作成自己的電子書。
  • 社群圖文貼文:每日/每週用 AI 畫圖+配一段創意文字,在 Instagram 、 X 或 Facebook 刊出,快速累積風格與粉絲。
  • 故事連載+視覺系列:將創作拆成「章節」+「每章畫圖」,展開系列連載,讓讀者期盼下一篇。
  • 寫作訓練工具:若您是作家或插畫師,可用 AI 生成靈感,再由您精修,作為養成創意能力的練習。

注意事項/實用 Tips

  • 雖然名稱說「免費」,但部分高階功能可能需付費或限制次數,建議先以「免費試用」為起點。
  • 文字提示越具體,畫圖效果越精準。建議描述「色調、光影、角度、背景元素」等。
  • 雖為 AI 產出,仍需您加入「人性化」元素:角色內心、轉折、情感描寫,畫圖也可修圖再發佈。
  • 若將創作商業化,請確認平台的使用條款/商業授權情況。
  • 創作完成後,建議備份作品(文字+圖片),確保資料安全。

參考資訊

https://www.chatartpro.com

哄哄模擬器教學|練習情商與溝通技巧的 AI 對話遊戲

哄哄模擬器教學|練習情商與溝通技巧的 AI 對話遊戲

「哄哄模擬器」是一款基於 AI 的情景模擬工具,讓你在不同對話場景裡練習溝通與情商,用語言技巧「哄」對方原諒你。無論是女友生氣、應酬場合、家庭矛盾,或朋友之間的摩擦,用「模擬對話」的方式體驗各種情境,提升對話能力與情感同理。本文會帶你了解功能、怎麼遊玩、優缺點與心得。

試著哄哄

選好一個主題,就可以開始試著挑戰如何烘好女友,並且獲取高分

https://hong.greatdk.com

  1. 開啟網站或下載 App
    • Web 版本:例如 hong.greatdk.com 可進入「哄哄模擬器 Web 版」。
  2. 選擇角色與情境
    選你要哄的人(如女友/男友/朋友/家人等)與場景(遲到、誤會、吵架、應酬等)。
  3. 開始對話
    系統給你對話機會、限定輪次或次數,用你的語言回應對方的情緒問題。
  4. 分數或原諒值機制
    • 若你的回覆合乎情境、誠懇、有同理心,就會提升「原諒值」。
    • 若不佳或冷漠,原諒值可能下降。達標即成功哄好對方。若掉到某個底線可能「失敗」。
  5. 練習與重來
    如果這次沒有哄好,可以換不同策略再試,從錯誤中學習如何說話更有情感、更有技巧。

功能特色

以下是哄哄模擬器的幾個主要特色,讓你知道這款工具能做什麼:

  1. 情境模擬對話
    可選擇多種日常生活中的場景,例如女友生氣、約會遲到、吃掉對方想吃的食物、約回家太晚、陪酒應酬、解決矛盾等。你扮演對話方,用語言試圖化解對方情緒。
  2. 有限次數制挑戰
    在大部分場景中,你有一次「哄對」的機會或者有固定的對話輪數/次數限制。對話中如果你表現不好,分數會下降;若表現好,原諒值提升。當原諒值達到某個標準或百分比時就成功「哄好對方」。如降為零則可能「被放棄」。
  3. 無需註冊或簡易入口
    Web 版與 App 程式都有提供入口。有些版本可以直接點進去模擬對話,體驗門檻低,不需要繁重註冊流程。
  4. 開源/免費版 HongHongAI
    有開源版 “HongHongAI” 專案,模仿原本「哄哄模擬器」功能,使用 Google 的 Gemini 作為大模型進行對話生成。免費版有每分鐘 60 次調用限制,提示與回應相對簡單,未經微調。
  5. 情感與語氣模擬
    對方的情緒反應會根據你講的內容、語氣(誠意/不誠意)而做調整。比如如果你道歉得真誠,語句得體,原諒值提升;若敷衍或講話浮誇或語氣不符,則可能反效果。這部分是訓練情商、同理心與語言搜索挖掘的重點。

優點與限制(實測與考慮)

優點

  • 提升情商與溝通技巧:在安全環境中練習如何哄人,比真實中犯錯成本低。
  • 場景豐富有趣:多場景設計讓使用者可以多樣練習,不會單調。
  • 門檻低:很多版本不用註冊或提供簡單資訊即可開始。適合想「試試看」的人。

參考資訊

https://top.aibase.com/tool/honghongmoniqi

https://weibo.com/1727858283/ND9pOzB0K?refer_flag=1001030103_

https://hong.greatdk.com

https://github.com/johanazhu/honghongai

GibberLink 教學:實現 AI 助理之間的加密音頻對話

GibberLink 教學:實現 AI 助理之間的加密音頻對話

GibberLink 是一項創新的開源專案,讓 AI 助理之間以更高效的方式進行音頻對話。​這項技術於 2025 年的 ElevenLabs 倫敦黑客馬拉松中脫穎而出,獲得了全球首獎。

🔍 GibberLink 是什麼?

GibberLink 是由 Boris Starkov 和 Anton Pidkuiko 兩位開發者在黑客馬拉松期間開發的開源專案。​其核心理念是讓 AI 助理在識別到對方也是 AI 時,切換到一種更高效的通訊協議,使用聲波傳輸結構化數據,而非傳統的人類語言。​這種方式不僅提高了通訊效率,還減少了計算資源的消耗。

⚙️ GibberLink 的運作原理

  1. 初始對話:​兩個 AI 助理以人類語言開始對話。
  2. 身份識別:​當其中一方識別到對方也是 AI 助理時,提出切換到 GibberLink 模式。
  3. 協議切換:​雙方同意後,切換到使用聲波傳輸數據的通訊協議。
  4. 數據傳輸:​利用開源的 ggwave 庫,將結構化數據編碼為聲波信號,進行高效的數據交換。

這種方式類似於早期撥號調製解調器的數據傳輸,但經過現代化的優化,更適合當前的 AI 通訊需求。​

🔐 AI 加密對話的實現

GibberLink 不僅提高了通訊效率,還注重數據的安全性。​在進行聲波數據交換時,AI 助理會使用非對稱加密技術(如 P-256 密鑰對)進行加密,確保通訊內容的保密性和完整性。​這種端對端的加密方式,即使通訊被攔截,也無法解密其中的內容。

🌐 如何體驗 GibberLink?

  • 線上體驗:​訪問 gbrl.ai,在兩個設備上打開該網站,即可觀察 AI 助理之間的音頻對話。
  • 開源代碼:​GibberLink 的完整代碼已在 GitHub 上開源,地址為 github.com/PennyroyalTea/gibberlink。​

🏆 為何值得關注?

  • 高效通訊:​GibberLink 模式下的 AI 對話比傳統語音通訊快約 80%,大幅提升了通訊效率。
  • 資源節省:​減少了語音生成和語音識別的計算資源消耗,降低了運營成本。
  • 安全保障:​採用先進的加密技術,確保通訊內容的安全性。
  • 開源共享:​開源的特性使得開發者可以自由使用、修改和擴展該技術。

🔧 GibberLink 安裝與本地部署教學

GibberLink 是一個開源專案,您可以在本地環境中部署並體驗 AI 之間的聲音通訊。​

1. 安裝 Node.js(建議版本:v20)

GibberLink 需要 Node.js 環境,建議使用 v18.18.0 或更高版本。以下是使用 NVM 安裝 Node.js 的步驟:

curl -fsSL https://raw.githubusercontent.com/nvm-sh/nvm/v0.39.4/install.sh | bash
source ~/.bashrc
nvm install 20
nvm use 20
nvm alias default 20  # 可選,將 Node.js 20 設為預設版本

2.下載並設定 GibberLink 專案

git clone https://github.com/PennyroyalTea/gibberlink.git
cd gibberlink
mv example.env .env

並且編輯 .env 檔案,填入您的 ElevenLabs 和 LLM 提供者的 API 金鑰。​

3.安裝相依套件並啟動專案

npm install
npm run dev

啟動後,您可以透過瀏覽器訪問 http://localhost:3003 來使用 GibberLink。​

參考資料