by Rain Chu | 7 月 10, 2026 | Agent , AI , Hermes
Hermes Agent v2026.5.16 這次最值得看的,不是功能清單變長,而是它開始從「開源 AI Agent 玩具」往「可以被日常使用、跨工具接入、跨平台部署的基礎設施」移動。
我會把這次更新的重點放在兩件事:第一是 Hermes Proxy ,它把你手上的 AI 訂閱轉成 OpenAI 相容端點,讓 Codex、Aider、各種只吃 API 的工具有機會共用同一套訂閱資源,第二是 支援 LINE ,這代表 Agent 不再只是終端機裡的工具,而可以進到大家每天真的會打開的通訊入口。
如果你之前看過站上的 Hermes Agent 完整實測 ,那篇比較像認識 Hermes 的核心能力,這篇則聚焦在 v2026.5.16 之後,它怎麼變得更適合放進真實工作流。
先講結論:Hermes 正在補「基礎設施」這塊
很多 AI Agent 專案一開始都很炫,但卡在幾個現實問題:Windows 使用者不好裝、安裝流程太工程師、啟動太慢、外部工具接不進來、通訊平台支援不完整、安全性也不一定能被團隊接受。
Hermes Agent v2026.5.16 的 Foundation Release,剛好就是在處理這些比較不性感、但非常關鍵的底層問題。它包含 Windows 原生支援、PyPI 安裝、冷啟動加速、CDP 呼叫加速、Hermes Proxy、跨 session 快取、`/handoff`、LINE / Teams 等 22 個通訊平台、供應鏈安全掃描,以及新的 vision / X 搜尋工具。
這類更新不一定每個都會讓人眼睛一亮,但它們合在一起,代表 Hermes 不是只想做 demo,而是想成為可以被部署、被整合、被長期使用的 Agent 系統。
Hermes Proxy:把 AI 訂閱變成工具能吃的 API 入口
Hermes Proxy 是這次我最想拉出來講的功能。
現在很多人手上其實已經有 ChatGPT Pro、Claude Pro 或其他 AI 服務訂閱,但問題是開發工具通常只認 OpenAI 相容 API,你在聊天介面裡可以用的能力,不一定能直接接到 Codex、Aider、OpenCode、CI pipeline 或自己的自動化腳本裡。
Hermes Proxy 的想法,是在本機跑一個 OpenAI 相容端點,讓上層工具以為自己正在呼叫一般 API,但後面實際連到的是你已經訂閱的 AI 服務,用比較白話的方式說,它像是一個「訂閱轉接器」:工具只要會講 OpenAI API 格式,就有機會透過 Hermes Proxy 使用不同 AI 服務。
這跟站上之前整理的 AISA 一個 API Key 連上多種資源 有一點相似:核心都不是單一模型,而是「資源層」。差別是 AISA 偏向外部 API 與技能資源整合,Hermes Proxy 則更像本機開發工具和 AI 訂閱之間的橋。
為什麼 Hermes Proxy 對 Codex 使用者有感?
如果你的主要工作介面是 Codex,Hermes Proxy 的吸引力在於:它可能把「聊天訂閱」和「開發工具 API」之間的牆變薄。
很多工具都有一個共同限制:它們可以接 OpenAI 相容 API,但不能直接使用你在瀏覽器登入的 Pro 訂閱。這會造成一種很尷尬的狀況:你明明已經付了訂閱費,實際做 automation 或 coding agent 時卻還要另外付 API 費。
Hermes Proxy 不是魔法,也不代表所有服務都能無限制、無成本地被轉接。真正部署前還是要確認各家服務條款、登入方式、速率限制和穩定性。但方向很清楚:把模型資源抽象成統一端點,讓工具選擇不再被單一 API 形態綁死。
這也和 OpenWork / OpenCode 桌面工作台 這類工具的需求接在一起,當本地 Agent 工作台越來越多,誰能穩定提供模型、工具、通訊平台與權限管理,誰就更接近真正可用的工作環境。
支援 LINE:Agent 從終端機走進日常入口
另一個我覺得很重要的更新,是 LINE Messaging API 變成 Hermes 的一等平台,同一波也提到 SimpleX Chat、Teams pipeline、Webhook adapter,整體支援平台數來到 22 個。
LINE 支援的價值不只是在「多一個聊天入口」,對台灣、日本和許多亞洲使用者來說,LINE 就是日常工作和生活的入口。Agent 如果只能待在終端機或瀏覽器,其實離一般使用場景還有一段距離,但如果它能進 LINE,就有機會變成隨手派任務、收通知、接收摘要的個人助理。
想像一下:你在路上用 LINE 傳一句「幫我整理今天重要郵件」、「把這個連結存成研究筆記」、「提醒我晚上回覆某個客戶」,後面由 Hermes 去接 Teams、Email、Webhook、模型和工具。這才是 Agent 真正進入生活流程的樣子。
站上以前也寫過 WooCommerce 透過 LINE 通知訊息 ,那是把系統事件推到 LINE,Hermes 這類 Agent 平台則更進一步,不只是通知,而是讓 LINE 變成可以對 Agent 下指令的入口。
Windows 原生與 PyPI:降低安裝門檻才有機會普及
這次還有兩個很務實的更新:Windows 原生支援,以及 `pip install hermes-agent`。
Windows 原生支援的意義很大。以前很多開源 AI 工具對 Windows 使用者都不太友善,不是要求 WSL,就是建議 Docker。這對工程師或許還可以接受,但對想試用 Agent 的一般使用者、產品經理、營運、內容工作者來說,門檻就高了很多。
現在 Hermes 可以在 CMD.exe 和 PowerShell 原生執行,對「公司電腦多半是 Windows」的場景尤其重要。再加上 PyPI 標準化安裝,管理版本、依賴和升級都比較符合 Python 生態的習慣。
我也查了 PyPI,`hermes-agent` 套件目前確實存在,套件摘要寫的是 self-improving AI agent,並標示 Python 版本需求為 3.11 以上、低於 3.14。這點對部署很重要,因為你不能只看安裝指令,還要確認 Python 版本。
pip install hermes-agent
hermes
效能更新:Agent 不能每次都讓人等
Hermes 這次也強調冷啟動約少 19 秒、`hermes tools all-platforms` 從十幾秒降到約 1.5 秒內,以及瀏覽器 CDP 呼叫透過持久 WebSocket 連線提升到 180 倍。
這些數字看起來像效能細節,但對 Agent 產品很關鍵。Agent 的工作流常常是「開一下、問一下、跑一下工具、再切回來」,如果每一步都慢,使用者很快就會放棄。速度不是錦上添花,而是能不能被日常使用的門檻。
這也呼應我最近整理的 Grill Me 需求訪談工作流 :Agent 要好用,不能只靠模型聰明,前面要把需求問清楚,中間要能快速呼叫工具,後面還要能保存上下文和交接狀態。
快取與 /handoff:模型不該是一次選死
跨 session 快取和 `/handoff` 也是這次值得看的設計。
跨 session 快取可以讓重複工作更快恢復,尤其是長任務、多輪對話、固定專案背景。
`/handoff` 則是把目前對話、工具呼叫、上下文轉移到另一個模型、角色或設定檔。這代表模型不再是一開始就選死,而是可以隨著任務階段切換。
例如架構設計階段用一個模型,實作階段換另一個模型,摘要或低成本批次處理再換成本更低的模型,這種彈性如果搭配 Hermes Proxy,就會變得更有意思:模型資源、訂閱資源、工具入口都被抽象出來,Agent 才有機會變成可調度的系統。
供應鏈安全:從開源專案走向團隊部署必補的一課
Hermes 這次也把供應鏈安全放進更新裡,包括安裝時掃描依賴套件、比對安全通報、Lazy Libs 延遲載入,以及在某些 wheel 不適用時做 fallback。
這類內容對個人玩家可能比較無感,但對公司或團隊很重要。AI Agent 如果要進入企業環境,不能只回答「好不好玩」,還要回答「能不能被安裝」、「依賴是否安全」、「出問題能不能追」、「部署會不會卡在平台相容性」。
所以我才會說這次 Foundation Release 的重點,不只是多了功能,而是 Hermes 開始補齊作為基礎設施需要具備的條件。
新工具與技能:從文字走向多模態與社群搜尋
新版也提到 `vision_analyze` 和 `x_search`,前者可以把畫面交給具備視覺能力的模型分析,適合錯誤畫面、UI 問題、截圖診斷,後者則把 X / Twitter 搜尋變成 Hermes 的一等工具。
再加上 9 個新技能,Hermes 的方向越來越明確:它不只是聊天,也不是單純工具集合,而是要把工具、通訊、模型、記憶、技能生成整合成一個能持續進化的 Agent 系統。
如果你關心本地 Agent 和模型搭配,可以接著看 Ornith 35B 配 Hermes 工作流 ,那篇更偏本地模型和 agentic coding,這篇則偏 Hermes 平台本身的基礎設施更新。
我會怎麼看這次更新?
我覺得 Hermes Agent v2026.5.16 的關鍵,不是「它現在支援很多平台」這句話,而是它開始回答一個更大的問題:AI Agent 要如何真正活在我們每天使用的工具裡?
Hermes Proxy 回答的是模型與訂閱資源如何被工具使用
LINE 支援回答的是 Agent 如何進入日常通訊入口
Windows 與 PyPI 回答的是一般使用者怎麼開始
快取、handoff、效能與安全則回答的是長期使用能不能穩
如果你已經在玩 Hermes,這次最值得優先測的就是 Hermes Proxy 和 LINE,前者關係到你能不能把 AI 訂閱接進更多開發工具,後者關係到 Agent 能不能從「我打開電腦才會用」變成「我在手機上也能派任務」。
FAQ
Hermes Proxy 是什麼?
Hermes Proxy 是 Hermes Agent 內建的本地代理層,目標是提供 OpenAI 相容端點,讓支援 OpenAI API 格式的工具可以接到不同 AI 服務或訂閱資源。
Hermes 支援 LINE 代表什麼?
LINE Messaging API 成為 Hermes 的一等平台後,使用者可以把 LINE 當成和 Agent 對話、派任務、收通知的入口,讓 Agent 更接近日常使用場景。
Hermes Agent 怎麼安裝?
目前可以透過 PyPI 安裝:`pip install hermes-agent`,再執行 `hermes` 啟動。PyPI 資訊顯示它需要 Python 3.11 以上、低於 3.14。
這次 Foundation Release 最重要的是什麼?
最重要的是 Hermes 開始補齊基礎設施能力,包括 Windows 原生、PyPI 安裝、Hermes Proxy、LINE/Teams 等通訊平台、效能優化、快取/handoff 和供應鏈安全。
by Rain Chu | 7 月 8, 2026 | AI , Hermes , 模型
Ornith 35B 真正有趣的地方,不是「小模型打敗大模型」這句話本身,而是它把本地 AI 編程 Agent 這條路線重新推到桌面上:我們是不是可以把一部分 coding agent 能力,從雲端 API 搬回自己的機器?
這個問題很現實。雲端工具反應快、整合好,但 token 成本、隱私、企業程式碼外流、模型選擇權,始終卡在開發者心裡。本地模型則剛好反過來:你要自己處理硬體、速度、部署與穩定性,但換來的是成本可控、資料留在本地,以及比較完整的架構控制權。
Ornith 1.0 前一篇已經整理過核心定位,這篇換個角度:如果把 Ornith 35B 接進 Hermes 這類 Agent 工作流,它應該放在哪裡?是主控模型、任務 worker,還是只適合做某些短程工具任務?
先講結論:35B 有想像空間,但不要把 benchmark 當保證書
Ornith 35B 的吸引力在於,它不是 397B 那種多 GPU 伺服器級模型,也不是 9B 那種比較像入門測試的輕量模型。35B 落在一個很微妙的位置:高階個人工作站有機會跑,能力又足以進入 coding agent 測試。
官方數據裡,Ornith 35B 在 Terminal-Bench 2.1 拿到 64.2,SWE-bench Verified 拿到 75.6。397B 更高,Terminal-Bench 2.1 為 77.5,SWE-bench Verified 為 82.4。這些分數很漂亮,但漂亮不等於放進你的專案就穩。
模型 Terminal-Bench 2.1 SWE-bench Verified 適合觀察的方向 Ornith-1.0-9B 43.1 69.4 低成本本地測試、短程 worker Ornith-1.0-35B 64.2 75.6 本地 coding agent 實驗主力 Ornith-1.0-397B 77.5 82.4 企業級或多 GPU 私有部署
這也是為什麼我不想把它寫成「35B 擊敗雲端大模型」這種單線結論。更準確的說法是:Ornith 35B 在某些 agentic coding benchmark 和視覺/前端生成任務上很值得測,但長程任務和大型 codebase 仍要小心。
Self-Scaffolding RL 到底改變了什麼?
一般 coding agent 常見的架構,是人類工程師先寫好 harness:
什麼時候讀檔、什麼時候跑 command、失敗怎麼 retry、怎麼記憶、怎麼驗證。模型很聰明,但它通常只是被放進這套流程裡填空。
Ornith 1.0 的 Self-Scaffolding RL 想走的是另一條路:
讓模型不只學 solution rollout,也學會產生任務 scaffold。換句話說,它不只是演員,也開始學會改劇本,任務跑得好,解法和引導解法的 scaffold 都一起被獎勵;任務跑得差,兩者都會被調整。
這和 前一篇 Ornith 1.0 介紹 裡談到的「先搭工作台,再開始解題」是同一件事。對開發者來說,重點不是模型多會補 code,而是它能不能在遇到限制、錯誤、缺資料時,重新安排自己的工作流程。
Hermes 的位置:還是 harness,但已經比較動態
Hermes 在這裡比較像運行時的動態編排層。它仍然是 harness,但不是傳統那種完全寫死的腳本;它可以在任務過程中調整步驟、改工具、補資料,讓 agent 比較像真的在做一件工作,而不是只照著固定模板回答。
把 Ornith 35B 接進 Hermes 的想像是:Hermes 負責任務框架、工具調用和流程管理,Ornith 35B 負責本地推理、程式生成、局部 debug 與前端/視覺任務。這樣的分工,比「讓 35B 一個模型主控所有事情」更合理。
站上之前有兩篇 Hermes 相關內容可以放在一起看:
Hermes Agent 完整實測 和 Hermes Agent WebUI 。如果 Hermes 是工作台,Ornith 35B 就是可以被放進工作台裡的一顆本地引擎。
實測起來
Ornith 的幻覺率仍然偏高,很多 fine-tune 模型 benchmark 強,但長程任務容易歇菜;更穩的方式可能是官方模型搭配優化過的 Jinja template 來跑長程任務。
小模型非常適合做 worker,處理葉節點任務,用完即毀;但如果拿它當整個系統的主控,很可能是用錯地方,可以當作 Ornith 35B 的導入原則。
短程、明確、可驗證的任務,可以交給 35B worker。
長程規劃、多輪重構、跨大型 codebase 的任務,先不要完全放權。
需要主控決策時,最好搭配更強模型或更嚴格的 Hermes/harness。
所有結果要能重跑、能測試、能看 log,不要只看模型自我回報。
這裡的核心不是「小模型沒用」,而是小模型要放對位置,主控、規劃、長上下文記憶是白領工作;批次修小 bug、生成局部元件、跑固定格式分析,反而是本地 35B 很適合切進去的地方。
本地部署的價值:不是零成本,而是可控成本
本地跑 Ornith 35B 很容易被包裝成「零 token 成本」。這句話只說對一半。雲端 token 成本下降了,但你換成了硬體成本、電費、散熱、維護、模型部署和速度瓶頸。
真正的優勢是可控。你知道模型跑在哪裡,知道資料是否離開內網,知道長任務不會因為 token 計費一路燒上去。對需要保護程式碼或內部文件的團隊,這比單純省錢更重要。
如果你本來就在研究本地 AI 開發環境,可以延伸看 Claude Code 搭配 LM Studio 與 Ollama 的零 API 成本環境 ,以及 Mac Studio 跑大型模型的 VRAM 調整 。Ornith 35B 的問題,最後仍然會回到你的硬體、記憶體和任務型態。
我會怎麼把 Ornith 35B 放進 Hermes?
我不會一開始就讓 Ornith 35B 當整個 Hermes 系統的最高決策者。比較合理的導入方式,是先讓它做 worker。
先挑 5 到 10 個固定任務,例如小型前端元件、局部 bug 修復、測試補齊、簡單重構。
每個任務都要有明確驗證方式,例如單元測試、Playwright 截圖、lint、build。
Hermes 負責任務切分、重試策略、log 收集和失敗回報。
Ornith 35B 只處理其中一段,不直接改全專案、不直接做不可逆決策。
連續跑幾輪,看錯誤類型是否固定,再決定要不要擴大權限。
這樣的測法比較慢,但比較接近真實工程,AI Agent 的能力不是靠一個漂亮 demo 決定,而是看它能不能在可重複、可驗證、可回滾的流程裡穩定工作。
Ornith 35B 是值得測的本地引擎,不是萬能主控
Ornith 35B 最好的位置,暫時不是取代 Claude Code、Codex 或雲端大模型,而是進入 Hermes 這類 agent 工作流,成為一顆可控、可替換、可驗證的本地推理引擎。
它的優點很清楚:成本可控、資料留在本地、前端與視覺任務有亮點、自我 debug 的思路值得追。它的風險也很清楚:benchmark 不能直接代表長程任務,幻覺與錯誤累積仍然存在,小模型放錯位置會把整個 agent 工作流拖垮。
所以我會把 Ornith 35B 放進觀察名單,但會用 worker 的方式開始,而不是把整個系統交給它。這條路如果走通,本地 AI 編程的價值就不是「省 token」而已,而是開發者重新拿回 AI 架構控制權。
by Rain Chu | 6 月 14, 2026 | Agent , AI , Hermes , OpenClaw , Prompt
當我們開始用 AI 寫網站、做 Landing Page、產生前端介面時,常常會遇到一個問題
畫面看起來很快就完成了,但總覺得「哪裡怪怪的」。
按鈕很像、卡片很多、漸層很浮誇、字級沒有層次、留白不夠精準,甚至每個 AI 產生的網站都像是同一套模板改出來的。這種「可以用,但不高級」的設計感,就是許多 AI 前端作品容易落入的平庸陷阱。
而 Impeccable 官方網站 想解決的,正是這個問題。
什麼是 Impeccable?
Impeccable 是一套專為 AI Coding Agent 設計的前端設計輔助工具,它不是單純幫你產生漂亮畫面的 AI 設計工具,而是提供一套「設計語彙」與「設計指令」,讓你可以更精準地指揮 AI 改善網站畫面。
簡單說,Impeccable 讓 AI 不只是會寫程式,也更懂設計。
它可以協助 AI 理解網站中的層級、對比、留白、色彩、字體、動畫、產品脈絡與品牌調性,讓 AI 產生的前端畫面不再只是堆滿卡片、套上漸層、加一點陰影,而是更接近真正設計師會思考的介面。
你可以把 Impeccable 想像成:
一套給 AI 前端工程師使用的設計總監指令集。
為什麼 AI 做出來的網站常常很平庸?
現在很多人會用 AI 幫忙做網站,例如請 Claude Code、Cursor、Codex CLI 或 Gemini CLI 產生頁面。AI 很擅長快速完成版型,但如果沒有足夠清楚的設計方向,它很容易產生幾種常見問題:
每個區塊都用卡片包起來,看起來很模板化
喜歡使用過度常見的紫色漸層、玻璃擬態、發光陰影
字體大小與層級不夠精準,主標、副標、內文沒有明確節奏
留白太平均,缺乏視覺重點
按鈕、表單、導覽列看起來功能正確,但沒有品牌感
Landing Page 和後台 Dashboard 使用同一種設計邏輯
作品看起來像 AI 產物,而不是成熟產品
Impeccable 的價值就在於,它不是只叫 AI「設計得漂亮一點」,而是提供更具體的設計方向,例如讓畫面更有層次、更安靜、更大膽、更精煉、更符合產品情境。
Impeccable 的核心特色
1. 提供 AI 可理解的設計語言
Impeccable 的官方介紹中提到,它補上了 AI Agent 缺少的設計語彙,這代表你可以用更接近設計師的方式指揮 AI,例如改善排版、調整顏色、強化視覺層次、降低過度設計、整理產品脈絡。
這對不熟設計術語的人很有幫助,因為你不需要長篇大論解釋「我要更高級、更有質感、更像品牌網站」,而是可以透過 Impeccable 的指令,把設計意圖轉成 AI 比較能執行的動作。
2. 支援多種 AI Coding 工具
Impeccable 可以搭配多種主流 AI Coding 工具使用,例如 Cursor、Claude Code、GitHub Copilot、Gemini CLI、Codex CLI 等。
這代表它不是只服務單一平台,而是比較像一套可以帶進不同開發流程的設計輔助層。對於已經習慣用 AI 寫前端的開發者來說,Impeccable 可以直接加入現有工作流程,不需要重新學一套完整設計軟體。
3. 透過指令改善網站設計
Impeccable 提供多個設計指令,讓你可以針對不同設計任務下達命令。例如:
/impeccable init 用來初始化專案,建立產品脈絡與設計方向。
/impeccable shape 在寫程式前先規劃 UX / UI,避免一開始就產生雜亂版型。
/impeccable critique 針對畫面的層級、清楚度、情緒感與設計品質做評論。
/impeccable audit 檢查技術品質,例如可及性、效能與響應式設計。
/impeccable polish 進行最後修飾,讓畫面更接近可上線品質。
/impeccable bolder 讓太保守、太無聊的畫面更有張力。
/impeccable quieter 讓太吵、太過度設計的畫面更穩重。
/impeccable distill 把畫面精煉到最核心的內容與視覺重點。
這些指令的好處是,你可以更像在跟設計師溝通,而不是一直對 AI 說:「再漂亮一點」、「再高級一點」、「不要這麼普通」。
4. 幫你減少 AI 生成網站的套路感
很多 AI 產生的網站會有明顯套路,例如紫色漸層、大量圓角卡片、發光邊框、過度一致的版面節奏。Impeccable 內建反套路的設計檢查,可以幫助你找出這些容易讓網站看起來廉價、模板化或過度 AI 感的元素。
這對品牌網站、形象頁、SaaS Landing Page、產品頁、作品集網站尤其重要。因為這些頁面的重點不只是功能完成,而是要讓使用者在第一眼感覺到專業、信任與差異化。
5. 保留你的設計系統,不是硬套新風格
Impeccable 的另一個優點是,它不是粗暴地把你的網站改成另一種風格,而是會盡量尊重既有的設計系統,例如顏色、字體、元件、間距、按鈕樣式與品牌規則。
這對已經有產品雛形或既有網站的人很重要。你不一定想要整個重做,而是希望 AI 幫你把現有介面整理得更成熟、更一致、更像一個真正的產品。
Impeccable 適合誰使用?
Impeccable 特別適合以下幾種人:
1. 用 AI 寫前端的開發者
如果你常用 Cursor、Claude Code、Codex CLI、GitHub Copilot 來產生 React、Next.js、Astro、Tailwind CSS 或其他前端頁面,Impeccable 可以幫你補上 AI 在設計判斷上的不足。
2. 想快速做出高質感 Landing Page 的創業者
很多創業者會用 AI 快速做 MVP,但 Landing Page 如果太普通,會影響使用者信任感,Impeccable 可以幫助你把「能用的頁面」推進到「比較有品牌感的頁面」。
3. 會寫程式但不擅長設計的人
你可能知道功能怎麼做,但不知道為什麼畫面不夠好看。Impeccable 可以用指令化的方式協助你檢查排版、層級、色彩與互動細節。
4. 想降低 AI 生成感的網站製作者
如果你的網站看起來太像 AI 產物,Impeccable 可以幫你找出常見的 AI 設計套路,讓畫面更有辨識度。
如何安裝 Impeccable?
你可以到 GitHub 下載與查看 Impeccable 專案:
Impeccable GitHub 下載頁
官方建議可以在專案根目錄執行:
npx impeccable skills install
接著在你的 AI Coding 工具中執行:
如果之後要更新,可以執行:
npx impeccable skills update
官方網站也提供更多說明與範例:
Impeccable 官方網站
使用 Impeccable 的工作流程建議
如果你正在做一個網站或前端產品,可以用以下流程開始:
第一步,先用 AI 產生基本頁面結構。 例如首頁、產品介紹、價格表、登入頁、後台儀表板。
第二步,執行 /impeccable init。 讓 Impeccable 了解你的產品定位、使用者、品牌語氣與設計方向。
第三步,用 /impeccable shape 先整理畫面架構。 這一步可以避免一開始就把版面做得太滿、太亂。
第四步,用 /impeccable critique 檢查設計問題。 讓 AI 幫你指出畫面層級、訊息清楚度與互動細節的問題。
第五步,用 /impeccable polish 做上線前修飾。 這一步可以讓網站更一致、更乾淨,也更接近可交付品質。
第六步,必要時使用 /impeccable audit。 檢查響應式、可及性、效能與技術層面的品質。
對 WordPress 網站製作者有什麼幫助?
雖然 Impeccable 本身比較偏向 AI Coding Agent 與前端開發流程,但對 WordPress 網站製作者也很有參考價值。
如果你使用 WordPress 搭配自訂佈景主題、區塊編輯器、Elementor、Bricks、Breakdance 或自製前端元件,你可以先在本機或開發環境中,用 AI 建立前端區塊,再透過 Impeccable 改善設計品質。
例如:
首頁 Hero 區塊不夠有記憶點
服務介紹區塊太像模板
價格表太普通
Call to Action 不夠明確
部落格列表頁缺乏層次
後台管理介面太陽春
品牌網站缺乏高級感
這些都可以透過 Impeccable 的設計指令進行調整,再整合回 WordPress 佈景主題或頁面模板中。
結論:Impeccable 讓 AI 網站設計從「能用」走向「有質感」
AI 讓網站製作變快,但速度不代表品質。真正影響使用者感受的,往往是那些細節:字體層級、留白、對比、色彩、互動節奏、品牌一致性,以及畫面是否有明確的設計意圖。
Impeccable 的重點不是取代設計師,而是讓 AI 更容易理解設計師的語言,也讓開發者可以用更精準的方式指揮 AI 做出不平庸的網站。
如果你正在用 AI 製作網站,卻覺得畫面總是差一點質感,那麼 Impeccable 很值得加入你的前端工作流程。
官方網站:https://impeccable.style/
GitHub 下載:https://github.com/pbakaus/impeccable
by Rain Chu | 6 月 13, 2026 | Agent , AI , GGUF , Hermes , OpenClaw
原本我在 Nvidia 都搭配 vLLM 啟動,這條路理論上可以發揮 NVFP4 權重的優勢,但在 DGX Spark 的 GB10 平台上,實際遇到 CUDA Kernel 與 Marlin repack 相容性問題。
最後我改採:
Hcompany/Holo-3.1-35B-A3B-GGUF
搭配 llama.cpp CUDA Build,成功啟動模型並提供 API 服務。
這篇文章記錄完整流程,也保留幾個重要的踩坑經驗。
環境
本次環境如下:
硬體:NVIDIA DGX SparkGPU:NVIDIA GB10系統:Ubuntu Linux模型儲存位置:/mnt/ai-models推論框架:llama.cpp模型格式:GGUF量化版本:Q4_K_M
DGX Spark 使用統一記憶體架構,因此 CPU、GPU 與系統服務會共用記憶體。這點對 vLLM 與 llama.cpp 都很重要。
為什麼放棄 NVFP4 + vLLM
一開始使用 vLLM 載入:
Hcompany/Holo-3.1-35B-A3B-NVFP4
後,權重其實已經完整載入:
Loading safetensors checkpoint shards: 100% Completed | 3/3Loading weights took 142.78 seconds
但載入完成後,仍然在 Marlin FP4 重新整理階段失敗:
NotImplementedError:Could not run '_C::gptq_marlin_repack'with arguments from the 'CUDA' backend
這代表模型檔案本身沒有問題,真正卡住的是 vLLM 的 CUDA Extension 在 DGX Spark GB10 上沒有完整提供所需的 Marlin CUDA Operator。
如果只是想先把 Holo 3.1 跑起來,不一定要繼續投入時間處理 NVFP4 相容性。改用 GGUF + llama.cpp 是更快、更穩定的選擇。
移除 NVFP4 模型快取
vLLM 下載的 Hugging Face 模型通常會放在:
/mnt/ai-models/huggingface/hub/
先確認路徑:
find /mnt/ai-models/huggingface \ -maxdepth 3 \ -type d \ -name 'models--Hcompany--Holo-3.1-35B-A3B-NVFP4' \ -print
確認容量:
du -sh \ /mnt/ai-models/huggingface/hub/models--Hcompany--Holo-3.1-35B-A3B-NVFP4
確認無誤後刪除:
rm -rf \ /mnt/ai-models/huggingface/hub/models--Hcompany--Holo-3.1-35B-A3B-NVFP4
1. 安裝編譯工具
sudo apt update
sudo apt install -y \ git \ build-essential \ cmake \ ninja-build \ libcurl4-openssl-dev \ pkg-config
2. 確認 CUDA Toolkit
export CUDA_HOME=/usr/local/cudaexport PATH="${CUDA_HOME}/bin:${PATH}"
export LD_LIBRARY_PATH="${CUDA_HOME}/lib64:${LD_LIBRARY_PATH:-}"
nvcc --versionnvidia-smi
nvcc --version 必須能正常回傳 CUDA 版本。
3. Clone llama.cpp
mkdir -p /mnt/ai-models/srccd /mnt/ai-models/srcgit
clone https://github.com/ggml-org/llama.cpp.gitcd
llama.cpp
如果之前已經下載過:
cd /mnt/ai-models/src/llama.cpp
git fetch origingit switch master
git pull --ff-only origin master
4. 編譯 CUDA 版本
cd /mnt/ai-models/src/llama.cpp
rm -rf buildcmake -B build \ -DGGML_CUDA=ON \ -DCMAKE_BUILD_TYPE=Releasecmake --build build \ --config Release \ -j 4 \ --target llama-server llama-cli
確認:
./build/bin/llama-server --version
./build/bin/llama-cli --version
下載 Holo 3.1 GGUF 模型
建立模型目錄:
mkdir -p \ /mnt/ai-models/llama-models/Holo-3.1-35B-A3B-GGUF
下載主模型、視覺投影模型與 Chat Template:
hf download \ Hcompany/Holo-3.1-35B-A3B-GGUF \ q4_k_m.gguf \ mmproj.f16.gguf \ chat_template.jinja \ --local-dir \ /mnt/ai-models/llama-models/Holo-3.1-35B-A3B-GGUF
確認:
ls -lh \ /mnt/ai-models/llama-models/Holo-3.1-35B-A3B-GGUF
應該看到:
q4_k_m.ggufmmproj.f16.ggufchat_template.jinja
單模型模式啟動
先用最簡單的單模型方式確認服務能運作:
cd /mnt/ai-models/src/llama.cpp
./build/bin/llama-server \ -m /mnt/ai-models/llama-models/Holo-3.1-35B-A3B-GGUF/q4_k_m.gguf \ --mmproj /mnt/ai-models/llama-models/Holo-3.1-35B-A3B-GGUF/mmproj.f16.gguf \ --jinja \ --host 0.0.0.0 \ --port 8080 \ -c 8192 \ -np 1 \ -ngl 999
參數說明:
--mmproj 指定視覺投影模型
--jinja 使用模型附帶的 Chat Template
-c 8192 Context Length
-np 1 同時處理 1 個請求
-ngl 999 儘可能將模型層放到 GPU
測試文字 API
curl -s http://192.168.0.240:8080/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Holo-3.1-35B-A3B-GGUF", "messages": [ { "role": "user", "content": "請使用繁體中文介紹你的 UI 畫面分析能力。" } ], "max_tokens": 256, "temperature": 0.2 }' | python3 -m json.tool
在這台 DGX Spark 上,實測文字生成速度約為:
測試圖片分析 API
curl -s http://127.0.0.1:8080/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "q4_k_m.gguf", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one concise English sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ], "thinking_budget_tokens": 64, "max_tokens": 1024, "temperature": 0.1 }' | python3 -m json.tool
已知問題:中文多模態輸出偶爾觸發解析錯誤
圖片推論本身可以成功,但在某些中文輸出中,llama-server 可能回傳:
Failed to parse input at pos ...
例如:
自由女神像、火炬、基座、城市天際線、高樓、水面、島嶼、樹木、旗�、船。
其中 � 是 UTF-8 無效字元替代符號。
實務上的處理方式:
1. 降低 temperature,例如 0.12. 限制輸出為簡短句子3. 提高 max_tokens,避免輸出被截斷4. Client 端遇到 500 時自動 Retry 一次5. 優先更新至最新版 llama.cpp
Router Mode:支援多模型切換
確認單模型模式正常後,可以啟用 Router Mode:
cd /mnt/ai-models/src/llama.cpp
./build/bin/llama-server \ --models-dir /mnt/ai-models/llama-models \ --models-max 1 \ --models-autoload \ --jinja \ --host 0.0.0.0 \ --port 8080 \ -c 8192 \ -np 1 \ -ngl 999
啟動後會看到:
Loaded 1 local model presets from /mnt/ai-models/llama-modelsAvailable models (1) Holo-3.1-35B-A3B-GGUFstarting router server, no model will be loaded in this processrouter server is listening on http://0.0.0.0:8080
Router 會在 Client 第一次呼叫時才載入模型。
查看模型清單:
curl -s \ 'http://127.0.0.1:8080/models?reload=1' | \ python3 -m json.tool
指定模型:
curl -s http://127.0.0.1:8080/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Holo-3.1-35B-A3B-GGUF", "messages": [ { "role": "user", "content": "請使用繁體中文簡短介紹你的功能。" } ], "max_tokens": 512, "temperature": 0.2 }' | python3 -m json.tool
Router Mode 的記憶體策略
我使用:
意思是:
可以讓 Client 選擇多個模型但同一時間只保留一個模型在記憶體中
這很適合 DGX Spark。因為 Holo 35B、KV Cache、圖片 Token 與系統服務都會共用統一記憶體。
如果要同時提供 Holo 與另一個 Tool Calling 模型,建議:
Holo 35B:Context 8192 或 16384用途:UI 截圖與視覺分析較小的文字 Tool Calling 模型:Context 65536用途:Hermes Agent 預設模型
不同模型需要不同 Context Length 時,可使用 models.ini:
version = 1
[*]
jinja = true
n-gpu-layers = 999
parallel = 1
[Holo-3.1-35B-A3B-GGUF]
model = /mnt/ai-models/llama-models/Holo-3.1-35B-A3B-GGUF/q4_k_m.gguf
mmproj = /mnt/ai-models/llama-models/Holo-3.1-35B-A3B-GGUF/mmproj.f16.gguf
ctx-size = 8192
[qwen-coder]
model = /mnt/ai-models/llama-models/qwen-coder-14b-q4_k_m.gguf
ctx-size = 65536
啟動:
./build/bin/llama-server \ --models-preset /mnt/ai-models/llama-models/models.ini \ --models-max 1 \ --models-autoload \ --host 0.0.0.0 \ --port 8080
讓 llama.cpp 開機就執行
一、確認執行檔路徑
先執行:
ls -lh /mnt/ai-models/src/llama.cpp/build/bin/llama-server
再確認模型目錄:
ls -lah /mnt/ai-models/llama-models
測試版本:
/mnt/ai-models/src/llama.cpp/build/bin/llama-server --version
如果這三個指令正常,就可以建立服務。
二、建立 systemd 服務
建立服務檔:
sudo nano /etc/systemd/system/llama-router.service
貼上:
[Unit]
Description=llama.cpp Router Server
Documentation=https://github.com/ggml-org/llama.cpp
After=network-online.target local-fs.target
Wants=network-online.target
RequiresMountsFor=/mnt/ai-models
[Service]
Type=simple
User=gwoyju
Group=gwoyju
WorkingDirectory=/mnt/ai-models/src/llama.cpp
Environment="LD_LIBRARY_PATH=/usr/local/cuda/lib64"
Environment="CUDA_HOME=/usr/local/cuda"
ExecStartPre=/usr/bin/test -x /mnt/ai-models/src/llama.cpp/build/bin/llama-server
ExecStartPre=/usr/bin/test -d /mnt/ai-models/llama-models
ExecStart=/mnt/ai-models/src/llama.cpp/build/bin/llama-server \
--models-dir /mnt/ai-models/llama-models \
--models-max 1 \
--models-autoload \
--jinja \
--host 0.0.0.0 \
--port 8080 \
-c 8192 \
-np 1 \
-ngl 999
Restart=on-failure
RestartSec=10
TimeoutStopSec=30
KillSignal=SIGTERM
LimitNOFILE=65535
[Install]
WantedBy=multi-user.target
儲存後離開:
WantedBy=multi-user.target 讓服務可以隨一般多使用者開機流程啟動;Restart=on-failure 會在程式異常退出時重新啟動服務。
為什麼需要 RequiresMountsFor
你的模型與程式都放在:
如果外接 SSD 尚未掛載完成,直接啟動 llama-server 會失敗。
這一行:
RequiresMountsFor=/mnt/ai-models
會要求 systemd 先準備好該掛載點,再啟動 Router。
三、啟用開機自動執行
重新讀取服務設定:
sudo systemctl daemon-reload
設定開機自動啟動,並立即啟動:
sudo systemctl enable --now llama-router
查看服務狀態:
systemctl status llama-router --no-pager
正常情況應該看到:
以及:
router server is listening on http://0.0.0.0:8080
四、查看即時日誌
查看最近 100 行日誌:
journalctl -u llama-router -n 100 --no-pager
持續追蹤日誌:
journalctl -u llama-router -f
離開即時日誌:
五、測試 Router API
確認 Router 已啟動:
curl -s http://127.0.0.1:8080/health
查看模型清單:
curl -s \ 'http://127.0.0.1:8080/models?reload=1' | \ python3 -m json.tool
測試 Holo 3.1:
curl -s http://127.0.0.1:8080/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Holo-3.1-35B-A3B-GGUF", "messages": [ { "role": "user", "content": "請使用繁體中文簡短介紹你的功能。" } ], "max_tokens": 256, "temperature": 0.2 }' | python3 -m json.tool
第一次呼叫時會需要等待模型載入。後續請求會比較快。
六、常用管理指令
啟動服務
sudo systemctl start llama-router
停止服務
sudo systemctl stop llama-router
重新啟動
sudo systemctl restart llama-router
查看狀態
systemctl status llama-router --no-pager
取消開機自動啟動
sudo systemctl disable --now llama-router
七、確認開機後是否真的自動啟動
重新開機:
重新 SSH 登入後執行:
systemctl status llama-router --no-pager
確認 Port:
測試模型清單:
curl -s http://127.0.0.1:8080/models | \ python3 -m json.tool
八、改用 models.ini
準備讓不同模型有不同 Context Length:
Holo 35B:8192Hermes 預設 Tool Calling 模型:65536
這種情況建議不要在服務中使用:
而是改用:
假設設定檔位於:
/mnt/ai-models/llama-models/models.ini
服務中的 ExecStart 改成:
ExecStart=/mnt/ai-models/src/llama.cpp/build/bin/llama-server \
--models-preset /mnt/ai-models/llama-models/models.ini \
--models-max 1 \
--models-autoload \
--host 0.0.0.0 \
--port 8080
改完後重新載入設定:
sudo systemctl daemon-reload
sudo systemctl restart llama-router
查看日誌:
journalctl -u llama-router -f
九、避免 Ollama 開機後搶占記憶體
你之前遇過記憶體不足。如果目前 DGX Spark 主要改用 llama.cpp,建議停用 Ollama 的開機自動啟動:
sudo systemctl disable --now ollama
確認:
systemctl status ollama --no-pager
未來需要恢復:
sudo systemctl enable --now ollama
十、限制只允許內網連線
目前使用:
代表區域網路內其他裝置可以存取 API。Router Mode 目前仍屬於實驗性功能;llama.cpp 啟動日誌也提醒,不建議直接暴露在不受信任的網路環境。
假設區域網路是:
可以設定 UFW:
sudo ufw allow from 192.168.0.0/24 \ to any port 8080 proto tcp
查看規則:
不要直接把 Port 8080 暴露到公網。
建議你現在直接執行的版本
建立 /etc/systemd/system/llama-router.service 後,執行:
sudo systemctl daemon-reload
sudo systemctl enable --now llama-router
systemctl status llama-router --no-pagerjournalctl -u llama-router -n 50 --no-pager
這樣 DGX Spark 每次重新開機後,llama.cpp Router Server 就會自動啟動,並等待 Hermes Agent 或其他 Client 指定要載入的模型。
參考資料
https://huggingface.co/collections/Hcompany/holo31
https://build.nvidia.com/spark/llama-cpp/instructions
by Rain Chu | 4 月 18, 2026 | AI , Hermes
🧠 Hermes Agent 是什麼?
Hermes Agent 是由 Nous Research 推出的開源 AI Agent 框架,具備:
🔁 跨對話記憶(Memory)
🧠 技能(Skill)可持續累積
🌐 內建網頁瀏覽與工具調用
⏱️ 任務排程(Cron-like)
🔌 OpenAI 相容 API(可接各種 LLM)
👉 本質上,它不是單純聊天機器人,而是「可執行任務的 AI 系統」
🖥️ Hermes WebUI(Dashboard)帶來什麼改變?
1️⃣ 從 CLI → GUI 的巨大轉變
過去:
OpenClaw / Agent 系統 → CLI + config + prompt
現在:
Hermes WebUI → 點擊操作 + 視覺化管理
👉 這是 AI Agent 商業化的關鍵一步
2️⃣ 多 Agent 管理(未來 SaaS 核心)
透過 WebUI,可以:
管理多個 Agent
設定不同任務流程
控制記憶與技能
👉 這意味著: 👉 你可以做「多人 AI 平台」
3️⃣ 技能(Skill)可視化
Hermes 最大亮點:
任務會被記錄成「技能」,並可重複使用
例如:
👉 這其實就是: 👉 AI workflow engine(未來企業標準)
Hermes 實作
先更新到最新版本
然後就可以直接啟用 hermes webui
之後就可以用瀏覽器使用,預設是 http://localhost:9119/
🔍 Hermes WebUI 深度觀察(關鍵洞察)
💡 與 Open WebUI 深度整合
在社群中有人指出:
Hermes 可以當成「有狀態的 LLM endpoint」
意思是:
WebUI(前端)
Hermes(Agent)
LLM(模型)
👉 三層架構:
User → WebUI → Hermes Agent → LL
「Hermes 開箱就像調教一週的 OpenClaw」
官方資訊
https://docs.openwebui.com/getting-started/quick-start/connect-an-agent/hermes-agent
第三方套件
https://github.com/nesquena/hermes-webui
by Rain Chu | 4 月 14, 2026 | AI , Hermes
🧠 什麼是 Hermes Agent?
近期在 GitHub 爆紅、甚至登頂排行榜的 AI Agent —— Hermes Agent ,被視為可能「完全取代」OpenClaw 的下一代架構。
它不只是 AI 工具,而是一個會學習、會記憶、會進化的 Agent 系統 。
👉 核心概念只有一句話:
「AI 不只是回答問題,而是累積經驗、變強」
🧬 為什麼 Hermes Agent 是結構性突破?
傳統 AI Agent(包含 OpenClaw):
每次任務 = 重新開始
沒有真正「記憶」
沒有「經驗累積」
而 Hermes Agent:
👉 導入「LLM Wiki + 學習迴圈」
🔁 Hermes Agent 的 4 大進化核心機制
1️⃣ Episodic Memory(任務記憶寫入)
每次任務結束,Agent 會寫入完整紀錄:
{
"task": "部署 API",
"steps": [
{"tool": "docker", "result": "success"},
{"tool": "gcloud", "result": "fail"}
],
"errors": ["permission denied"],
"duration": "32s"
}
👉 這不是 log,是「可學習資料」
2️⃣ Retrieval(經驗檢索)
下一次遇到類似任務:
👉 不是重來 👉 而是「先查歷史」
例如:
「上次部署失敗是因為 IAM 權限問題」
👉 直接避開錯誤
3️⃣ Skill 抽象(自動技能生成)
當某個流程成功 ≥ 3 次:
👉 自動轉成 skill(Markdown)
# deploy-cloud-run
steps:
- build image
- push to artifact registry
- deploy cloud run
📌 特點:
遵循 agentskills.io 標準
可共享 / 可版本化
真正「技能庫」
👉 這就是 AI 會「學會做事」的關鍵
4️⃣ Honcho 使用者建模(人格記憶)
跨 session 記住你:
偏好用 CLI 還是 GUI
是否喜歡 Terraform
過去拒絕的方案
因為它會變成:
「懂你 workflow 的 AI」
🔍 FTS5 + LLM 搜尋能力(超關鍵)
Hermes Agent 使用:
你可以直接問:
「上週我們討論過哪個 API 設計?」
👉 它真的找得到,而且會整理給你
這點遠超過一般 AI memory
⚙️ Provider 無痛切換(超實用)
不用改 code:
hermes model
直接切換:
OpenAI
Claude
Ollama
本地模型
👉 完全符合你多模型架構需求
🛡️ 安全性測試(B+ 評級)
Hermes Agent 在安全測試中達到:
👉 B+ 等級
代表:
基本 prompt injection 防禦
任務隔離能力
Tool 使用風險控制
📌 對企業環境安全很重要
⚡ 安裝方式(超快)
Mac / Linux / WSL2
curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash
⚔️ Hermes Agent vs OpenClaw
項目 Hermes Agent OpenClaw 記憶 ✅ 長期記憶 ✅ 依靠 md 文件 學習能力 ✅ 自動進化 ❌ 弱 Skill 系統 ✅ 自動生成 ✅ 手動安裝 使用者建模 ✅ Honcho ❌ 無 搜尋能力 ✅ FTS5 + LLM ❌ 弱 模型切換 ✅ 一行指令 ⚠️ 需設定 圖形介面 ❌ 無 ✅ WEB 外部資源 ❌ 剛開始 ✅ 支援豐富,skill超多
👉 結論:
Hermes 是「會成長的 Agent」,OpenClaw 是「會執行的 Agent」 ,我兩個都要
🧠 為什麼它會「越用越強」?
因為它形成一個閉環:
任務 → 記錄 → 檢索 → 優化 → 抽象 skill → 再使用
👉 這就是真正的:
🔥 自我進化 AI
🧩 實際應用(你可以做什麼)
以你現在的技術背景,可以直接做:
1️⃣ DevOps AI Agent
自動部署 Cloud Run
自動修復錯誤
記住你的 GCP 架構
2️⃣ WordPress 維運 Agent
自動修 DB 問題
自動處理圖片路徑
學習你的 wp-cli 操作
3️⃣ AI 自動化工程師
幫你寫 Terraform
幫你 debug CI/CD
幫你優化效能
🧨 關鍵結論
👉 Hermes Agent 不是工具升級 👉 是 AI 架構世代升級
開始使用
多人使用
可以使用 hermes profile create + 使用者名稱,詳細指令
hermes profile create agent-name
關鍵資源
Agent Skills
HermesAgent One Wechat bot, two AI brains
近期留言