立創實戰派 ESP32-S3 最吸引我的地方,不是單一規格有多高,而是它把一個語音 AI 裝置需要的零件先整合好了,有彩色觸控螢幕、雙麥克風、喇叭、攝影機、姿態感測器、TF 卡與無線連線都放進同一個小型外殼,拿到手後可以先燒錄小智 AI,也能從 ESP-IDF 與 LVGL 開始做自己的應用。
如果只是想快速體驗語音助理,使用現成韌體就不必先建置編譯環境,想學 ESP32-S3、改介面或加入感測器,再走原始碼編譯路線。這兩條路應該分開看,先完成最短的可用流程,再決定要不要進入韌體開發。
內容目錄
先講結論
- 想最快用起來,下載立創實戰派對應的小智 AI 預編譯韌體,燒錄後完成 WiFi 配網與裝置綁定
- 想學完整開發流程,使用 VSCode、ESP-IDF 外掛與官方例程
- 想做可操作的圖形介面,可以從 LVGL 掌機範例開始修改
- 想更換大語言模型或使用自己的 API 金鑰,應把設定放在小智後端,不要把密鑰寫死在 ESP32 韌體
- 這塊板子整合度高,但攝影機只有 30 萬畫素,WiFi 只支援 2.4 GHz,外殼也偏向開源學習用途
立創實戰派 ESP32-S3 是什麼
立創官方技術文件把它定位成更接近實際產品的全功能開發板。核心模組是 ESP32-S3-WROOM-1-N16R8,搭載雙核心 Xtensa LX7 處理器,最高時脈 240 MHz,另外有 16 MB Flash 與 8 MB PSRAM。這樣的容量足以容納圖形介面、音訊處理、網路通訊與較大的韌體分割區。
| 項目 | 規格 | 可以拿來做什麼 |
|---|---|---|
| 主控模組 | ESP32-S3-WROOM-1-N16R8 | 雙核心 240 MHz,16 MB Flash,8 MB PSRAM |
| 螢幕 | 2 吋 ST7789 IPS,320 × 240 | 狀態介面、選單、動畫與影像預覽 |
| 觸控 | FT6336 電容觸控 | 直接在螢幕操作 LVGL 介面 |
| 攝影機 | GC0308,30 萬畫素 | 基礎影像擷取、人臉偵測與視覺實驗 |
| 姿態感測器 | QMI8658 六軸 IMU | 角度、移動與震動偵測 |
| 音訊輸入 | ES7210 搭配雙麥克風 | 語音喚醒、指令與即時對話 |
| 音訊輸出 | ES8311、NS4150B 與 1W 喇叭 | 語音回應、音樂與提示音 |
| 連線 | 2.4 GHz WiFi、Bluetooth 5 LE | 雲端 AI、裝置控制與藍牙 HID |
| 擴充 | TF 卡與兩組 GH1.25 介面 | 檔案儲存、GPIO、I2C、UART、CAN 與 PWM |
板子尺寸約為 69 × 41 × 14 mm,外殼不用螺絲就能拆開。不過官方商品頁也特別說明,外殼採用 3D 列印與黏貼工藝,高溫下可能變形,長時間使用也可能變黃或變脆。它適合學習、原型與桌面裝置,不應直接把這個外殼當成量產產品的結構標準。
ESP32-S3 具備 AI 向量指令,適合加速喚醒詞、訊號處理與小型邊緣模型,但它不是用來直接執行一般數十億參數 LLM 的主機。板子的原理圖、PCB、軟體例程與分章教學都有公開,S3 與 C3 則是兩套不同資料,下載時要先確認型號,不能只因外觀接近就混用韌體。
兩條上手路線怎麼選
| 路線 | 適合對象 | 需要準備 | 第一個成果 |
|---|---|---|---|
| 直接燒錄 | 第一次接觸 ESP32 或只想用小智 AI | Windows 電腦、資料傳輸線、Flash Download Tool | 可以喚醒與對話的語音終端 |
| 原始碼編譯 | 要改功能、畫面、喚醒詞或伺服器 | VSCode、ESP-IDF、Git 與對應版本的原始碼 | 可自行維護與燒錄的韌體 |
| 官方應用例程 | 要學螢幕、音訊、感測器與 LVGL | 立創資料包與相符的 ESP-IDF 版本 | 掌機介面與六種示範功能 |
對初學者來說,我會先走直接燒錄。確認麥克風、喇叭、螢幕與網路都正常後,再安裝開發環境。這樣遇到編譯或驅動問題時,至少知道硬體本身沒有壞。
方法一:直接燒錄小智 AI 韌體
小智 AI 已經支援立創實戰派 ESP32-S3。最省時間的做法是從 xiaozhi-esp32 Releases 下載檔名包含 lichuang-dev 的韌體壓縮檔。版本號會持續更新,請依發佈頁面的最新穩定版本操作,不要只找舊教學裡固定的版本。
- 下載並解壓縮
v版本號_lichuang-dev.zip - 從 Espressif 官方下載 Flash Download Tool
- 開啟工具後將 ChipType 選為
ESP32-S3 - 載入解壓縮後的韌體,起始燒錄位址設為
0x0 - 用具備資料傳輸能力的 USB Type-C 線連接開發板
- 選擇新增的 COM 連接埠,鮑率可先使用
921600 - 先按
ERASE清除舊韌體,再按START開始燒錄 - 完成後重新插拔 USB 線,或按下 RST 鍵重新啟動
如果 ERASE 或 START 失敗,先重新插拔開發板,再改用另一個 COM 連接埠或降低燒錄速度。電腦完全看不到連接埠時,第一件事是換一條確定能傳資料的 USB 線,不要先懷疑韌體。
小智 AI 的發佈包通常提供可從 0x0 寫入的合併韌體。其他範例若提供四個分開的 bin 檔,就要同時載入四個檔案,並逐一填入套件標示的位址。合併韌體與分割韌體的寫法不同,不能看到 bin 檔就全部設成 0x0。
第一次開機的配網與啟用
- 用手機連上開發板建立的
Xiaozhi-xxxx無線網路 - 如果沒有自動跳出設定頁,在瀏覽器開啟
192.168.4.1 - 選擇家中或手機熱點的 2.4 GHz WiFi,輸入密碼後等待重新啟動
- 開啟 xiaozhi.me 並登入控制台
- 新增裝置,輸入開發板螢幕上的六位數啟用碼
- 重新啟動後說出喚醒詞,確認收音、連線與播放都正常
ESP32-S3 的無線網路只支援 2.4 GHz。手機熱點若固定在 5 GHz,開發板就不會出現在可連線清單。配網頁打不開時,可以暫時關閉手機行動數據,只保留連到開發板的 WiFi。這種 AP 配網概念也可以延伸參考我之前整理的 ESP32 WiFi 配網做法。
完成基本對話後,可以再試著要求調整螢幕亮度,確認語音服務不只會回答問題,也能把意圖轉成板端控制。這種從對話到裝置動作的能力,才是把語音 AI 做成實體終端最有意思的地方。
小智可以連其他 LLM 嗎
可以,但要先分清楚板端與後端的責任,ESP32 主要負責喚醒、收音、播放、螢幕與網路傳輸。語音活動偵測、語音辨識、LLM 推理與語音合成通常由伺服器完成,再透過 WebSocket 把結果送回裝置。API 金鑰因此應放在伺服器端,不是直接寫進開發板。
使用官方小智服務時,可以在 xiaozhi.me 控制台調整官方提供的模型與角色。目前官方專案說明預設讓個人使用者連接 Qwen 即時模型。若要接自己選擇的供應商、模型或 API 金鑰,比較完整的路線是部署 xiaozhi-esp32-server,再從伺服器設定 LLM、ASR 與 TTS provider。
自架後端的流程是 ESP32 把音訊送到伺服器,伺服器依序完成 VAD、ASR、LLM 與 TTS,再把合成語音送回 ESP32 播放。這和 Hugging Face speech-to-speech 語音 Agent 的模組化概念相近。如果想把 LLM 留在自己的電腦或內網,可以再參考 本地大模型推理框架比較,選擇 Ollama、llama.cpp 或其他 OpenAI 相容服務。
正式部署時不要把 API 金鑰提交到 GitHub,也不要把沒有驗證的 WebSocket 服務直接開放到公網。至少要使用環境設定或伺服器端設定檔保存密鑰,限制管理介面來源,並為裝置與管理者建立不同權限。
方法二:安裝 ESP-IDF 開發環境
立創教學使用 VSCode 搭配 Espressif IDF 外掛。官方例程原本以 ESP-IDF 5.1.4 製作,也測試過 5.2.2。另一方面,現在的 xiaozhi-esp32 主線已經把 6.0.2 列為優先版本,5.5.2 主要保留給舊板相容。這兩組版本不要混為一談,使用立創例程就照例程要求,編譯最新小智主線則照該版本 README。
ESP-IDF 可以線上安裝,也能先使用官方資料準備好的離線安裝程式。新手在 Windows 上比較適合先走離線路線,安裝速度通常更可預期,也比較不容易在 Python 環境與工具鏈下載階段卡住。線上安裝的好處是版本選擇直接,但網路中斷時需要更多除錯經驗。
- 安裝 VSCode
- 在延伸模組中安裝 Espressif IDF
- 執行 Configure ESP-IDF Extension
- 選擇 EXPRESS 快速安裝
- 選擇伺服器與指定的 ESP-IDF 版本
- 將 ESP-IDF 與 IDF_TOOLS 放在不同資料夾
- 等待 ESP-IDF、工具鏈與 Python 虛擬環境完成安裝
- 開啟例程後選擇正確連接埠、
esp32s3目標與 USB 轉串口下載方式
工程路徑最好只使用英文字母與數字,也不要放空白。若圖形介面操作不順,也可以在 ESP-IDF 終端使用以下基本命令。
idf.py set-target esp32s3
idf.py fullclean
idf.py build
idf.py -p COM19 flash monitor
COM19 只是 Windows 範例,請換成自己電腦實際出現的連接埠。macOS 與 Linux 會是不同名稱。編譯環境安裝失敗時,不要在原資料夾反覆疊加不同 IDF 版本,先確認目前工程需要哪一版,再重新選定工具鏈。
VSCode 的 ESP-IDF 外掛也有把建置、燒錄與終端監看串在一起的操作。第一次可先跑 Hello World,看到燒錄完成並在終端持續輸出,才表示工具鏈、連接埠與下載方式都已經通過。若建置速度慢到數小時,先看工作管理員是否有殘留的編譯程序,也檢查防毒軟體是否反覆掃描 build 資料夾。只應為可信任的專案目錄建立最小排除範圍,不要長時間關閉整套即時防護。
從原始碼編譯小智 AI
需要修改喚醒詞、後端位址、介面或裝置功能時,可以直接取得官方原始碼。
git clone https://github.com/78/xiaozhi-esp32.git
cd xiaozhi-esp32
idf.py set-target esp32s3
idf.py menuconfig
idf.py fullclean
idf.py build
idf.py flash monitor
在 menuconfig 內選擇立創實戰派 ESP32-S3 對應板型,並確認 Flash、PSRAM、分割表、字型與 LVGL 設定符合專案文件。板上有 16 MB Flash,不代表任意分割表都會自動用滿。從別的開發板設定切換過來時,先執行 fullclean,可以減少舊的 sdkconfig 與建置產物造成的錯誤。
目前主線對 ESP-IDF 版本的要求已經和早期立創教學不同。若只是要使用小智 AI,直接燒錄 Releases 裡為 lichuang-dev 建好的韌體會穩定很多。只有準備修改程式時,才值得投入時間處理版本、分割表與驅動相容性。
掌機範例其實是一套產品介面
立創提供的 14-handheld 範例使用 LVGL 做出類似手機的主畫面。它不是完整的遊戲模擬器,而是一個把板上週邊整合到同一套觸控介面的參考專案。主畫面包含六個應用。
- 姿態與運動監測,顯示 XYZ 角度並判斷震動
- 音樂播放器,從音訊系統輸出內容
- TF 卡瀏覽器,查看目錄與檔名
- 攝影機預覽,將畫面送到螢幕
- WiFi 連線,掃描網路並取得網路時間
- 藍牙控制器,將開發板當成 HID 裝置控制手機或電腦音量
這個範例的價值在於學會如何讓 LVGL、觸控、音訊、感測器與網路共用同一個應用生命週期。想做桌面資訊面板、智慧家庭控制器、兒童學習機或語音 Agent 終端,都可以從這套架構刪掉不需要的頁面,再加入自己的功能。
還沒有拿到實體板時,可以先用 Wokwi ESP32 與 Arduino 模擬器 練習基礎 GPIO 與程式結構。不過實戰派的專用螢幕、音訊 codec、攝影機與完整腳位配置仍需要真機驗證。
最容易踩到的問題
- USB 只有供電沒有資料,結果電腦完全找不到連接埠
- 手機熱點使用 5 GHz,ESP32-S3 無法搜尋
- 立創例程與最新小智主線使用不同 ESP-IDF 版本
- 切換板型後沒有清理舊建置資料,導致驅動或分割表錯誤
- 把 API 金鑰寫進公開韌體或 Git 儲存庫
- 把掌機示例誤認成現成遊戲系統,低估後續 UI 與應用開發工作
- 帶電插拔 TF 卡,造成檔案系統損壞
- 使用 exFAT 格式記憶卡,卻沒有先確認 ESP-IDF 範例的檔案系統支援
另外不要為了看內部結構就直接拆螢幕。螢幕與外殼之間使用黏性很強的雙面膠,熱風可能先讓 3D 列印外殼變形,撬動也可能傷到面板或排線。一般檢查只需要滑開後蓋,除非已經接受零件損壞風險,否則不值得繼續拆。
我會怎麼開始
第一天先燒錄預編譯的小智 AI 韌體,完成配網、綁定與語音測試。第二步跑官方掌機例程,確認螢幕、觸控、IMU、TF 卡、攝影機、WiFi 與藍牙都能單獨工作。第三步才建立自己的專案,把不需要的功能移除,留下語音、畫面與一個最重要的感測器。
這塊板子真正適合的不是只做一個會聊天的盒子,而是把語音 Agent 變成有螢幕、有感測器、能控制周邊的實體入口。ESP32 不需要負責執行大型模型,它應該專心處理即時互動與硬體,重運算交給後端。把這個邊界想清楚,後續更換模型、接 MCP 或搬到本地伺服器都會容易很多。
FAQ
立創實戰派 ESP32-S3 在哪裡購買
可以從立創開發板專案頁查看介紹,也可以到立創商城商品頁確認庫存、價格與出貨內容。商品型號是 LCKFB-SZPI-ESP32-S3-VA,下單前仍要依當下頁面確認版本與配送地區。
一定要自己編譯韌體嗎
不用。只想使用小智 AI 時,下載立創實戰派對應的預編譯韌體即可。要改板端功能、畫面、喚醒詞、後端位址或加入自己的硬體時,才需要安裝 ESP-IDF 並重新編譯。
可以使用 OpenAI、Gemini 或本地模型嗎
可以,但是否直接支援取決於你使用的後端。官方 xiaozhi.me 提供自己的模型選項。要填入第三方 API 金鑰或接本地 LLM,建議自架相容的小智伺服器,在後端選擇 provider 與保存密鑰,再讓開發板連到該伺服器。
它能直接跑大型語言模型嗎
不能把一般數十億參數的大型語言模型直接放進 ESP32-S3 執行。板端負責音訊、畫面、感測器與通訊,LLM 推理放在雲端、電腦、NAS 或獨立 AI 主機上。
為什麼手機找不到配網熱點
先確認韌體燒錄完成且裝置已重新啟動,再檢查手機是否開著 WiFi。設定上游網路時必須使用 2.4 GHz。若設定頁沒有自動開啟,可以手動連上 Xiaozhi-xxxx 後瀏覽 192.168.4.1。
近期留言