Knowledge / RAG
Semark:把 PDF / Office / HTML / 圖片轉成 RAG-ready Semantic Markdown
整理 Semark 開源工具:用 MinerU + VLM/LLM 把 PDF、Office、HTML、圖片轉成 semantic Markdown、chunks、source maps 與主文/子文件,補足 OCR 對流程圖、表格、UI 截圖語意關係的缺口。Apache-2.0。
2026年7月22日1 分鐘閱讀👁 5
RAG Ingestion / Document AI
Semark 解決的是「OCR 有字,但 RAG 沒懂」
把 PDF 丟進 RAG 不代表內容真的進去了。Semark 用 MinerU 做解析/OCR/layout evidence,再接 VLM/LLM 做表單、流程圖、截圖、圖片語意與最終品質修復,輸出 RAG-ready Semantic Markdown、chunks、source maps 與自動分檔。
核心價值:RAG 前處理不能只追求「抓到字」,而要保留欄位關係、流程條件、按鈕路徑、紅框提示與圖片語意,否則 retrieval 召回的是碎片,不是知識。
GitHub reality check
KingsleyOWO/Semark GitHub API 顯示 repo 建立於 2026-06-17、主要語言 Python、Apache-2.0 授權,描述為把 PDFs、Office、HTML、images 轉成 RAG-ready semantic Markdown,含 MinerU、VLM/LLM review、chunks、source maps、自動文件拆分。Threads 發文時約 17 stars,屬早期但方向明確的工具。
| 文件痛點 | Semark 做法 | 對 RAG 的影響 |
|---|---|---|
| 流程圖 | 把條件、分支、負責單位寫成結構化 Markdown。 | 可以回答「如果 A 條件成立要走哪個流程」。 |
| 表單 / 表格 | 重建用途、欄位分組、填寫規則、法律聲明。 | 避免 OCR 欄位湯,提升 precision。 |
| UI 截圖 | 將 menu/button paths、紅框、欄位提示、畫面文字轉成可檢索描述。 | 操作手冊不再只剩死圖。 |
| 長文件 | 主文 + 表單/流程圖/圖片子文件自動拆分。 | chunk granularity 更可控,減少混雜召回。 |
| 隱私 | 支援 pattern-based private info masking,預設開啟。 | 降低 screenshot OCR/VLM 把個資送進 KB 的風險,但不是萬能 DLP。 |
Allen / BigIntTech 用法:
- 適合測 Allen KB / OneDrive 文件 mirror 的進階 ingestion:尤其 PDF、流程圖、SOP、表單、報帳/保險文件。
- 若處理敏感文件,優先本機 Ollama / 內網 OpenAI-compatible endpoint;不要直接把含個資截圖送外部 VLM。
- PoC 驗收不要只看 Markdown 漂亮,要用問答集測:欄位、流程分支、截圖提示是否真的可被召回。
- 早期 repo,正式導入前要檢查 Docker、queue、錯誤重試、檔案清理、source map checksum 與輸出 schema 穩定性。
補充來源:
GitHub: https://github.com/KingsleyOWO/Semark
README.zh-TW: https://github.com/KingsleyOWO/Semark/blob/main/README.zh-TW.md
GitHub: https://github.com/KingsleyOWO/Semark
README.zh-TW: https://github.com/KingsleyOWO/Semark/blob/main/README.zh-TW.md
來源:
Threads: https://www.threads.com/@wyunjen.ovo/post/DbFiDWxAdA5
Threads: https://www.threads.com/@wyunjen.ovo/post/DbFiDWxAdA5