載入中...
載入中...
Threads 討論能否把違規停車檢舉變成「拍照後十秒完成」。可驗證的現成工具包括 FixTW(自動代入地址、時間浮水印、影片轉檔、認證信、排程送出)與 tools.pylot.dev(GPS/地址/車牌/違規事實產生簡訊報案格式)。真正可落地的短期版本應是半自動:照片 GPS/OCR/車牌/表單預填 + 人工確認;全自動判定違規仍有法律與誤判風險。
整理 Semark 開源工具:用 MinerU + VLM/LLM 把 PDF、Office、HTML、圖片轉成 semantic Markdown、chunks、source maps 與主文/子文件,補足 OCR 對流程圖、表格、UI 截圖語意關係的缺口。Apache-2.0。
iOS OCR Server 使用 Apple Vision Framework,把 iPhone 變成可在區網調用的本地 OCR server;GitHub 已約 1.5k stars,MIT 授權。
LlamaIndex 將 LiteParse v2 以 Rust 重寫,提供 Rust、Node、Python、WASM 與 CLI 多語言介面,主打本地、無 LLM、無 API key 的快速文件解析。它適合 agent/RAG 工作流中需要快速讀 PDF、產生 bounding boxes、截圖與瀏覽器端解析的場景;但複雜表格、掃描文件與高準確率 OCR 仍應和 LlamaParse、Docling 或專用 OCR 流程比較。
Chandra OCR 2 的重點不是單純辨識文字,而是把 PDF、掃描文件、表格、公式、手寫表單等保留結構後轉成 Markdown/HTML/JSON,降低 RAG 與 Agent 文件處理的清洗成本。
這篇 Hugging Face 文章最值得記的,不只是 OCR 了 3 萬篇論文,而是它展示了一條很完整的 AI 內容處理產線:找缺口、選 benchmark、挑開源模型、用 agent 寫腳本、再用 serverless GPU 大規模跑完。