LiteParse v2:Rust 重寫後,PDF 解析從後端批次工具變成 agent 即時能力
LlamaIndex 將 LiteParse v2 以 Rust 重寫,提供 Rust、Node、Python、WASM 與 CLI 多語言介面,主打本地、無 LLM、無 API key 的快速文件解析。它適合 agent/RAG 工作流中需要快速讀 PDF、產生 bounding boxes、截圖與瀏覽器端解析的場景;但複雜表格、掃描文件與高準確率 OCR 仍應和 LlamaParse、Docling 或專用 OCR 流程比較。
LiteParse 是開源、本地執行的文件解析器,專注在「快速且輕量」的 PDF / 文件文字抽取,不依賴 LLM、不需要雲端 API key。
官方 blog 指出 v2 將整個專案改寫成 Rust core,並提供 Rust、Node、Python、WASM 套件;小文件因少了 Node process 啟動成本可看到 5–100x 加速,大文件約 3x。
即時 agent、RAG ingestion、瀏覽器端 PDF 處理、批次文件初篩、需要 bounding boxes / screenshots 作為視覺引用的工作流。
「最快」不是所有文件型態下的絕對結論;Threads 回覆也提醒只比速度不夠,解析品質、表格、多欄、掃描件與 OCR 才是 production pipeline 的關鍵。
LiteParse v2 提供什麼?
以 PDFium 為核心抽取文字,保留頁面中的空間位置與 layout;JSON 輸出可包含每個 text item 的座標、寬高與內容。
官方文件展示可用 bounding boxes 搭配 screenshot,在原始 PDF 圖像上標出資訊來源位置。這對需要可稽核答案的 agent / RAG 很重要。
LiteParse 預設用內建 Tesseract,並且只在原生文字抽取不足或頁面包含圖片時執行 OCR;也可接 EasyOCR、PaddleOCR 或自建 HTTP OCR server。
除 PDF 外,也可透過 LibreOffice / ImageMagick 先將 DOCX、XLSX、PPTX、圖片等轉成 PDF,再進入同一條解析 pipeline。
@llamaindex/liteparse-wasm 可在瀏覽器內解析 PDF bytes,不需 server;但瀏覽器版沒有內建 Tesseract、HTTP OCR、檔案路徑輸入與 Office 轉檔。
官方 README 提供 agent skill 安裝方式:npx skills add run-llama/llamaparse-agent-skills --skill liteparse,可讓 Claude Code、Codex、OpenCode 類工具直接使用。