by Rain Chu | 7 月 11, 2026 | Tool
企業知識庫和 AI Agent 最麻煩的地方,常常不是模型不夠聰明,而是資料進不來。PDF、掃描合約、研究報告、表格、圖片型文件,看起來都只是文件,但對 RAG 或 Agent 來說,它們必須先被轉成穩定、乾淨、可引用的結構化內容。
Docling 就是在解這個入口問題。它不是只把 PDF 拆成純文字,而是把文件版面、閱讀順序、表格、公式、圖片、OCR 結果整理成 AI 更容易消化的格式,例如 Markdown、HTML、JSON。對要做企業知識庫的人來說,這一層通常比後面換哪一個聊天模型更關鍵。
Docling 適合解決什麼問題
Docling 是 IBM Research Zurich 發起的開源專案,採用 MIT License。它支援 PDF、DOCX、PPTX、XLSX、HTML、EPUB、圖片與音訊等格式,官方也強調它能和 LangChain、LlamaIndex、CrewAI、Haystack 這類生成式 AI 工具鏈整合。
如果只是把少量文件轉成 Markdown,微軟的 MarkItDown 會很輕巧,之前我也整理過 MarkItDown 教學 ,但 Docling 的定位更偏向文件理解管線,尤其是 PDF 版面、表格、掃描文件、VLM 輔助解析這些較複雜的場景。
最基本的使用方式
Docling 的入門方式很直接,Python 環境建好後先安裝依賴:
pip install litellm google-generativeai docling
最小 Python 範例可以用 DocumentConverter 讀取 PDF,再輸出 Markdown:
from docling.document_converter import DocumentConverter
source = "https://arxiv.org/pdf/2408.09869"
converter = DocumentConverter()
result = converter.convert(source)
markdown_text = result.document.export_to_markdown()
print(markdown_text)
也可以用命令列直接轉檔:
docling https://arxiv.org/pdf/2408.09869
這種方式很適合處理數位原生 PDF,例如論文、報告、產品文件。它能保留標題層級、段落、表格與部分版面資訊,後續要切 chunk、做向量化、放進 RAG 都比較順。
掃描 PDF 要接 VLM 才會真正好用
企業場景裡最痛的通常是掃描件。掃描合約、舊報紙、模糊文件、影印後再掃描的 PDF,傳統 OCR 很容易漏字、錯行、表格亂掉,Docling 的強項之一,是可以把解析流程接到視覺語言模型,讓 VLM 協助理解頁面。
本地部署路線可以用 LM Studio 載入 InternVL3-9B,讓 Docling 透過 OpenAI 相容 API 呼叫本機模型,這個做法的優點是資料不必送到外部雲端,適合公司內部文件、客戶資料、合約與敏感文件。缺點是需要顯卡資源,也要接受本地模型在模糊文字上的上限。
如果追求辨識品質,Gemini 2.5 Pro 這類雲端 VLM 的效果通常會更穩,尤其是模糊掃描、複雜版面、引用格式、符號與表情符號。代價就是 API 成本、資料外送與權限控管,真正落地時,我會把它分成兩條管線:一般文件走本地模型,低信心或高價值文件再送雲端模型複核。
一個實用的企業知識庫流程
先把 PDF、Word、Excel、HTML、圖片掃描件集中到同一個資料夾或物件儲存。
用 Docling 轉成 Markdown 或 JSON,保留頁碼、標題、表格與圖片資訊。
針對掃描件啟用 OCR 或 VLM 管線,低品質文件可以標記信心分數。
清理內容,移除頁首頁尾、重複頁碼、錯誤斷行,再依標題與段落切 chunk。
把 chunk 放入向量資料庫,同時保存原始頁面來源,方便回答時回溯引用。
接到 RAG、Agent 或 Notebook 型工具,讓使用者可以查詢、摘要、比對文件。
之前整理過 GraphRAG 使用本地端的 Ollama ,或是 Open Notebook 這類私有研究工作流,前面都需要穩定的文件解析層。Docling 可以放在最前端,負責把混亂文件變成 AI 能讀的乾淨材料。
LM Studio、InternVL3、Gemini 怎麼選
如果資料敏感,先選 LM Studio 加 InternVL3。這種配置比較像私有 OCR 與文件理解服務,可以在內網跑,也能和既有 Python 管線整合。若你已經在評估 Qwen 或其他本地模型,也可以參考 Ollama Qwen 3.6 怎麼選 和 本地端多模態分析實戰 的思路。
如果文件很雜、品質很差、需要快速拿到高準確度結果,Gemini 2.5 Pro 會比較省心。尤其是頁面裡有表格、引用、符號、圖片文字混在一起時,雲端 VLM 的容錯能力會更好。我的建議不是二選一,而是分層使用:本地模型做第一輪,難件再升級到雲端模型。
導入前要注意的坑
第一,Python 版本要注意,Docling 近期版本已經不支援 Python 3.9,建議直接用 Python 3.10 以上,專案環境也要隔離,避免和舊套件衝突。
第二,不要只看 Markdown 有沒有產生,真正要檢查的是段落順序、表格欄位、頁碼引用、公式、圖片說明、錯字率。只要這些地方亂掉,後面的 RAG 回答就會變得不可信。
第三,VLM 不是魔法,模糊掃描、歪斜頁面、低解析度照片仍然會出錯。比較穩的做法是保存原始頁面圖、解析後文字、模型信心與人工校對狀態,讓知識庫能追蹤每一段內容從哪裡來。
結論
Docling 值得放進 AI 知識庫工具箱,原因不是它可以把 PDF 轉 Markdown 這麼簡單,而是它把文件解析變成一條可組合的管線。一般文件用基礎轉換,掃描件加 OCR,高難度文件再接 VLM,最後輸出成 RAG 可以使用的 Markdown 或 JSON。
如果你的資料來源大多是網頁和乾淨文字,Docling 不一定是第一個要上的工具。但只要公司文件裡有大量 PDF、掃描件、表格、舊報告,它就是很值得測的入口層。AI 系統的回答品質,很多時候從文件被讀進來的那一刻就決定了。
FAQ
Docling 和 MarkItDown 差在哪裡?
MarkItDown 很適合快速把常見文件轉成 Markdown。Docling 更偏向完整文件理解,強調 PDF 版面、表格結構、OCR、VLM 和 AI 工具鏈整合。
一定要用 Gemini 才能處理掃描 PDF 嗎?
不一定。本地可以用 LM Studio 搭配 InternVL3 這類視覺模型。Gemini 的優勢是複雜文件辨識品質通常更好,但需要考慮 API 成本和資料外送。
Docling 適合企業內部知識庫嗎?
很適合,特別是資料來源包含 PDF、掃描件、簡報、表格和舊文件時。它可以把文件轉成 AI 較容易處理的格式,再交給 RAG 或 Agent 使用。
by Rain Chu | 4 月 24, 2026 | Agent , AI , Microsoft , Tool
在 AI 時代,「讓 AI 看懂文件」變成一個非常關鍵的能力,但現實世界的資料格式五花八門,從 PDF、Word 到 PPT、甚至影片與音訊,這些內容對 AI 來說其實並不好直接處理。
這時候,MarkItDown 就成為一把真正的「文件瑞士刀」。
由 Microsoft 開源推出,MarkItDown 能將各種格式的檔案,一鍵轉換成乾淨、結構化、AI 友善的 Markdown,讓 ChatGPT、Claude 或各種 AI Agent 能輕鬆理解與分析。
你只要把 https://github.com/microsoft/markitdown 網址貼給 agent ,請他安裝就可以了
🚀 為什麼 MarkItDown 這麼強?
MarkItDown 最大的優勢只有一句話:
👉 幾乎什麼格式都能轉,而且還轉得漂亮
📂 支援格式(強到誇張)
🧾 辦公文件
PDF
Word(DOCX)
PowerPoint(PPTX)
Excel(XLSX / XLS)
🌐 網頁內容
🖼️ 影像檔
JPG / PNG
支援 OCR 文字辨識
可搭配 AI 產生圖片描述
🎧 音訊檔
WAV / MP3
自動語音轉文字(Speech-to-Text)
📊 資料格式
📦 其他進階格式
ZIP(自動解壓並轉換)
Outlook 郵件
YouTube(自動擷取字幕)
EPub 電子書
✨ 不只是轉檔,而是「結構理解」
很多轉檔工具的問題是:
👉 轉出來變成一坨純文字(完全不能用)
但 MarkItDown 不一樣,它會:
保留標題層級(# ## ###)
還原表格結構
保留清單與段落
維持超連結
👉 轉出來就是 AI 可以直接理解的 Markdown 結構
這對以下應用非常關鍵:
RAG(檢索增強生成)
AI 文件摘要
Agent 自動閱讀文件
⚡ 安裝與使用(超簡單)
安裝
pip install "markitdown[all]"
👉 如果只需要特定格式:
pip install "markitdown[pdf,docx,pptx]"
CLI 使用
markitdown 報告.pdf -o 報告.md
Python 使用
from markitdown import MarkItDownmd = MarkItDown() result = md.convert("文件.docx")print(result.markdown)
👉 幾行程式碼就搞定
🤖 搭配 AI:威力直接翻倍
MarkItDown 真正強的地方,是它「原生為 AI 設計」。
🧠 AI 圖片理解
可串接 OpenAI 視覺模型
自動產生圖片描述
讓 AI 看懂圖片內容
🔍 OCR 文字辨識
整合 Azure Document Intelligence
可讀取掃描 PDF / 圖片文字
🔌 MCP(Model Context Protocol)整合
可直接接入 Claude Desktop
或各種 AI Agent 系統
👉 這點對在做 AI Agent / LangChain / 自動化流程 特別重要
🧩 外掛系統
📌 實際應用場景
1️⃣ 餵 AI 吃文件(超省 Token)
👉 先轉 Markdown,再丟 AI
效果:
Token 減少最多可達 80%
AI 理解更準確
2️⃣ 建構企業知識庫(RAG)
流程:
文件 → MarkItDown → Markdown → Embedding → Vector DB
👉 完整 AI 知識庫 pipeline
3️⃣ AI Agent 文件閱讀能力
在你的 Agent 流程中加入:
文件 → MarkItDown → LLM 分析
👉 Agent 直接具備「讀文件能力」
4️⃣ 會議紀錄自動化
錄音 → 轉文字 → Markdown → AI整理
👉 自動產出結構化會議紀錄
⚠️ 不是萬能
MarkItDown 雖然強,但有幾個限制:
複雜圖表(Chart / Graph)解析較弱
高度排版文件可能失真
不適合做「高保真排版還原」
👉 如果你要的是「完美排版還原」
建議用: 👉 Pandoc
👉 如果你要的是「讓 AI 看懂」 👉 MarkItDown 完勝
🧠 結論:AI 時代的文件標準工具
MarkItDown 解決了一個非常關鍵但常被忽略的問題:
👉 AI 看不懂文件格式
它的價值在於:
✅ 超廣格式支援
✅ 保留結構(不是純文字)
✅ 原生為 AI 設計
✅ 可整合 Agent / RAG / 自動化流程
✅ 免費開源
👉 如果你正在做:
AI Agent
文件分析
自動化流程
知識庫建構
MarkItDown 是 AI Agent 必裝工具。
by Rain Chu | 3 月 18, 2025 | AI , Chat , Prompt , Tool
Flowith 最近正迅速崛起,成為超越 Manus 的最強 AI 自動化工具。它不僅免費且無需邀請碼,還具備強大的 ORACLE 模式、自主知識花園創建等功能,為用戶提供無與倫比的 AI 互動體驗。
Flowith 的主要特色
1. 免費使用,無需邀請碼
與其他需要邀請碼的 AI 工具不同,Flowith 完全免費,任何人都可以立即註冊並使用,無需等待或邀請碼。
2. ORACLE 模式:自動化完成文件、簡報製作
Flowith 的 ORACLE 模式是一項突破性的功能,允許數十個甚至數百個 AI 代理同時為您工作,無需手動搭建工作流。這使得複雜的數據收集和分析任務變得輕而易舉,並能自動生成文件和簡報等。
3. 知識花園:創建並變現知識庫
Flowith 的「知識花園」功能讓您可以將自己的知識資源組織成系統化的知識庫,並可選擇對外分享或收費,實現知識變現。
4. 邀請鏈接:獲得額外免費對話次數
透過邀請朋友加入 Flowith,您可以獲得額外的 500 次免費對話次數,提升使用體驗。
邀請碼如下:
https://flowith.io/invitation?code=WPS1WR
如何使用 Flowith
註冊帳號 :訪問 Flowith 官方網站 ,點擊「註冊」並填寫相關資訊。
探索 ORACLE 模式 :在主介面中,選擇 ORACLE 模式,輸入您的需求,系統將自動規劃並執行相關任務。 https://doc.flowith.io
建立知識花園 :上傳您的資料或文件,Flowith 會自動將其拆分為知識種子,幫助您構建個人知識庫。
參考資料
by Rain Chu | 3 月 17, 2025 | AI , Chat , Tool
DeepSeek R1 模型已經在 NVIDIA 平台上線,這是一個擁有 6710 億參數的開放式專家混合模型(MoE),專為解決需要高級 AI 推理的問題而設計的,但就是官方API不穩定,只能到處尋找替代的解決方案。
DeepSeek R1 的主要特點
API 友好性 :DeepSeek R1 提供了多種 API 接口,支持 Python、LangChain、Node.js 和 Shell 等,方便開發者根據需求選擇合適的開發環境。
免費使用額度 :NVIDIA 為個人和企業用戶提供了免費的使用額度。個人用戶可獲得 1000 點額度,企業用戶則可獲得 4000 點額度,讓更多人能夠體驗和使用該模型。
如何開始使用 DeepSeek R1
以下是使用 DeepSeek R1 的基本步驟:
註冊並獲取 API 密鑰 :
前往 NVIDIA NIM 平台的 DeepSeek R1 頁面:
點擊右上角的「Login」或「Get API Key」,按照提示完成註冊並獲取 API 密鑰。
選擇開發環境並調用 API :
Python :使用 OpenAI 兼容的客戶端調用 DeepSeek R1。 python複製編輯
LangChain :可將 DeepSeek R1 集成到 LangChain 框架中,實現更複雜的語言處理任務。
Node.js 和 Shell :NVIDIA 提供了相應的 SDK 和示例代碼,開發者可根據官方文檔進行集成。
用 python 來做示範
from openai import OpenAI
client = OpenAI(
base_url = "https://integrate.api.nvidia.com/v1",
api_key = "YOUR_API_KEY"
)
completion = client.chat.completions.create(
model="deepseek-ai/deepseek-r1",
messages=[{"role":"user","content":"你的問題內容"}],
temperature=0.6,
top_p=0.7,
max_tokens=4096,
stream=True
)
for chunk in completion:
if chunk.choices[0].delta.content is not None:
print(chunk.choices[0].delta.content, end="")
注意事項
使用額度 :請留意您的免費使用額度,合理規劃 API 調用次數。
參考資料
https://build.nvidia.com/deepseek-ai/deepseek-r1
by rainchu | 10 月 7, 2024 | AI , MIS , Tool
看到完全免費的軟體就覺得很佛心,但沒想到還支援AI重點摘要,還有個平台都可以使用,功能還比一堆付費軟體還強大,就真的一定要大力的推廣這麼優秀的軟體
免費的PDF編輯軟體PDFgear
特色功能介紹
內建AI摘要:快速幫忙重點整理
文檔編輯:可以編輯文字,也可以加入圖片
合併PDF:常用來加入 EXCEL 做出來的圖表
拆分PDF:可以設定如何拆分PDF,再重新合併一份文件
多平台支援:支援 windows, mac, ios, android
PDFgear核心功能
官網下載
https://www.pdfgear.com
相關資訊
by rainchu | 9 月 5, 2024 | AI , Tool , 簡報製作
Mapify 是一個心智圖的 AI 在線工具,專門為了快速且有效地整理和視覺化資訊而設計,無論是學生、教育者、專業人士或任何需要整理大量資訊的人士,都會發現這個工具非常有用。Mapify.so 的核心功能是將文檔(如 Word 或 PDF 文件)轉換成結構化的心智圖,這種轉換不僅迅速,而且保留了原始資訊的豐富性和複雜性。
主要功能
文件轉心智圖 : 使用者只需上傳一份文件,Mapify 就能自動解析文件內容,並將其轉換成一個互動的心智圖。這對於理解複雜的概念、學習新資訊或準備考試和報告特別有幫助。
即時心智圖生成 : 使用者可以輸入一個主題或一句話,Mapify 會根據這些資訊即時生成一個心智圖,適合於快速生成一個概念或項目,並且是腦暴會議中不可或缺的工具。
編輯和自訂 : 生成的心智圖不是靜態的,可以自由地添加、刪除或重新組織節點,使其更符合個人需求或更清晰地反映思考過程,這種靈活性是 Mapify 的一大賣點。
互動和共享 : 完成的心智圖可以共享給其他使用者,支持協作編輯。這使得它成為團隊項目和協作學習的理想選擇。
使用場景
教育 :教師可以利用此工具快速創建課程的心智圖,幫助學生理解和記憶重點。
業務會議 :在商業環境中,快速梳理會議內容或計劃策略時,心智圖可以提供清晰的視覺支持。
個人學習 :學生和終身學習者可以用它來整理學習材料或研究資料,提高學習效率。
近期留言