Academic Literature Mining Skill:用 Rust、Nemotron 與 Qdrant 做可查證的學術文獻探勘 | Allen 知識庫 | Allen 知識庫Research / AI Tools / Agents
Academic Literature Mining Skill:用 Rust、Nemotron 與 Qdrant 做可查證的學術文獻探勘
Threads 介紹 Ruisi-Lu/academic-literature-mining-skill:一個 Apache-2.0 的 Rust 文獻探勘/agent skill,強調 citation-complete、persistent identifier 驗證、Crossref/OpenAlex/arXiv/Semantic Scholar metadata、授權 PDF 保存、PDFium 原生文字+頁面影像、NVIDIA Nemotron Embed/Rerank VL、Qdrant retrieval 與 SQLite provenance。作者也提醒 Codex+GPT-5.6 sol 容易瞎掰,需要檢查 reasoning;此工具定位是用 vector RAG 與 provenance 降低 AI 憑內在記憶胡說。
2026年7月20日5 分鐘閱讀👁 4
Academic Research / Agent Skill / Literature Mining
不是叫 AI「幫我寫論文」,而是先建立可查證的文獻證據庫
Ruisi 在 Threads 宣傳 academic-literature-mining-skill,標語是「想讓 AI 幫你寫出頂刊等級的論文」。實際查 GitHub 後,這個 repo 的核心更準確地說是:用 Rust 建一套 citation-complete scholarly literature mining pipeline,讓 agent 先搜尋、驗證、保存、索引可授權的文獻與 PDF 頁面,再讓後續寫作引用可追溯的證據,而不是依賴模型內在記憶產生看似合理的 citation。
Kate 判斷:這篇值得收,但標題要降溫。它不是「自動寫頂刊」保證器,而是把學術寫作最容易翻車的環節——假文獻、錯 DOI、沒授權 PDF、引用不完整、RAG chunk 丟失圖表/公式——往前移到 corpus 建置與 provenance 審核。對 Allen KB / Hermes Skills 的價值在於:研究型 agent 必須把「證據可追溯」做成 workflow invariant,而不是最後再請模型自我檢查。
Threads 重點
| 訊號 | 內容 | 解讀 |
|---|
| 主貼 | 「想讓 AI 幫你寫出頂刊等級的論文就這麼簡單」,並附 GitHub repo。 | 宣傳語偏誇張;repo 實際是文獻探勘與 citation evidence pipeline。 |
| 作者補充 | 「用 codex + gpt5.6 sol 有點容易出現瞎掰的問題,記得檢查一下 reasoning」。 | 作者自己也承認 agent/LLM 仍會 hallucinate;工具不是免審查,而是降低 hallucination 的資料層。 |
| 回覆說明 | 「這是利用 vector rag 技術進行文獻探勘的工具,可以讓 AI 不以內在記憶胡言亂語」。 | 核心定位是 RAG + provenance,不是 end-to-end 代寫論文。 |
GitHub reality check
| 項目 | 查證結果 |
|---|
| Repo | Ruisi-Lu/academic-literature-mining-skill |
| 描述 | Citation-complete agent-assisted scholarly literature mining in Rust with NVIDIA Nemotron and Qdrant。 |
| 語言 / runtime | Rust;Cargo package name academic-literature-mining,binary name litmine。 |
| 建立 / 更新 | created 2026-07-18;updated 2026-07-20;pushed 2026-07-19。 |
| Stars / forks | GitHub API 查到 34 stars / 2 forks(2026-07-20)。 |
| License |
| Apache-2.0;repo license metadata 與 LICENSE file 均確認。 |
| Release | 未找到 GitHub latest release;目前看起來仍是直接從 main build。 |
| 版本 | Cargo.toml 顯示 version 0.1.1、publish = false。 |
它實際想解決什麼
README 說,多數 literature-search agents 只優化「找到看起來合理的標題」,但研究不能只靠 plausible titles。這個專案把每個搜尋結果都視為 untrusted,直到它通過:
- scholarly metadata source 解析與 persistent identifier 驗證;
- quality / relevance gates;
- retraction、withdrawn、paratext 排除;
- citation completeness 檢查;
- full-text authorization 檢查;
- PDF checksum、license assertion、raw metadata、provenance 保存。
架構:search subagents 搜,Rust coordinator 驗
| 層 | 作用 |
|---|
| Budget search subagents | 做 bounded、read-only candidate discovery,只輸出 strict NDJSON IDs;不拿 NVIDIA/Qdrant credentials,也不下載 paper。 |
| Rust coordinator | 獨立解析 DOI、arXiv ID、OpenAlex ID,做 metadata canonicalization、dedupe、quality/relevance gate。 |
| Metadata sources | Crossref、OpenAlex、arXiv, optional Semantic Scholar enrichment。 |
| PDF archive | 只下載 openly licensed 或 otherwise authorized PDF;保存原始 PDF、SHA-256、license、來源 provenance。 |
| PDFium rendering | 每頁保留 embedded native text + 完整頁面 image;無 usable text 時 image-only fallback;不做 OCR。 |
| NVIDIA Nemotron | 使用 nvidia/llama-nemotron-embed-vl-1b-v2 做 multimodal embedding,nvidia/llama-nemotron-rerank-vl-1b-v2 rerank。 |
| Qdrant | 向量索引;Docker Compose 預設 bind localhost,搭配 API key。 |
| SQLite | 保存 state/provenance,讓大型 corpus run 可恢復。 |
| Exports | CSL JSON、BibTeX、RIS、canonical JSONL、audit report。 |
為什麼「PDF 頁面影像 + 原生文字」這點重要
很多 RAG 系統只切文字 chunk,圖表、公式、版面、表格常被丟掉。這個 repo 的設計是每一頁都用 PDFium 擷取 native text,並渲染完整頁面 image,再以 text_image 形式送進 Nemotron Embed/Rerank。README 特別說 NVIDIA Embed/Rerank API 不吃 raw application/pdf payload,而是接受 text 與 base64 image data URL;所以完整頁面渲染是必要視覺輸入。
重要 caveat:pipeline 不做 OCR,也不把頁面拆成 semantic chunks。README 明確提醒:extracted text 是 retrieval metadata,不是 citation source;真正要引用或下結論時,仍要打開 preserved original PDF page 驗證。
安裝與執行條件
| 需求 | 說明 |
|---|
| Rust | stable 1.97.1 or newer;使用 cargo build --release --locked。 |
| Docker Compose | 啟動 Qdrant;docker-compose.yml 預設 127.0.0.1:6333/6334。 |
| NVIDIA Build API key | 必要;供 Nemotron Embed/Rerank hosted inference。 |
| OpenAlex API key | README 說 OpenAlex discovery / OpenAlex-only identifier resolution 需要。 |
| Contact email | 用於 polite Crossref requests。 |
| 可選 Semantic Scholar key | optional enrichment。 |
典型命令
cp .env.example .env
# edit .env: NVIDIA_API_KEY, OPENALEX_API_KEY, CONTACT_EMAIL, QDRANT_API_KEY
cargo build --release --locked
docker compose up -d qdrant
cargo run --release --locked -- doctor --prepare-pdfium --check-qdrant
cargo run --release --locked -- mine \
--plan assets/research-plan.example.json \
--workspace corpus --max-candidates 1000
也可拆 stage resume:discover、refresh-metadata、screen、download、render、ingest、export、audit、status。
研究 plan 的設計
assets/research-plan.example.json 要求明確定義:
- research question 與 query variants;
- inclusion / exclusion criteria;
- date range、languages、sources;
- preprints 是否允許;
- target papers、minimum quality score;
min_relevance_score。README 特別提醒預設 0.0,Nemotron relevance score 只做排序,不應未校準就拿來當 absolute acceptance gate。
學術寫作使用邊界
- 這不是自動保證頂刊論文:它是 corpus / retrieval / citation provenance pipeline;研究問題、理論貢獻、方法品質仍需人類研究者負責。
- RAG 降低但不消除 hallucination:作者自己在 Threads 補充 Codex + GPT-5.6 sol 仍容易瞎掰,要檢查 reasoning。
- 預印本要小心:SKILL.md 要求優先 formal published / peer-reviewed version;preprint 只能在無正式版本且必要時明確標註。
- 授權 PDF 才能下載:專案明確要求不要從 URL 可存取就推論有下載權限。
- 向量結果只是候選:README/SKILL 都要求引用前重開原始 PDF page 驗證。
對 Allen / Hermes 的啟發
研究型 agent 要先做 evidence OS
Deep Research 不能只靠多 agent 搜尋;必須有 identifier resolution、license/provenance、audit、citation export,否則只是把 hallucination 包裝得更像研究。
Subagent 權限邊界值得學
search workers 不拿 secrets、不下載 PDF、不寫 Qdrant,只回傳候選 ID;coordinator 才做驗證與寫入。這是安全的 agent 分工模式。
KB / 論文 / 報告都需要 provenance
Allen KB 目前保存來源 URL 與 metadata;若未來做企業 research agent,可以借鑑這種 SQLite + original artifact + checksum + canonical citation + audit 的架構。
來源