paper-fetch:讓 AI 讀論文前,先合法拿到 DOI 對應全文 PDF 的 route ladder | Allen 知識庫 | Allen 知識庫Research Tools / Academic AI
paper-fetch:讓 AI 讀論文前,先合法拿到 DOI 對應全文 PDF 的 route ladder
陳柏威分享 paper-fetch:給 DOI 後依序嘗試 Open Access、出版社官方 TDM API、自己的機構/圖書館 proxy,最後輸出 resolver link;沒有 Sci-Hub,重點是把 AI 論文學習流程中「拿全文」這段合法自動化。
2026年7月14日3 分鐘閱讀👁 5
Threads 驗證|Academic Workflow|PDF Fetcher
AI 讀論文的瓶頸常常不是模型,而是你有沒有合法拿到全文
陳柏威在 Threads 分享 paper-fetch:一個 publisher-aware full-text PDF fetcher。它的目標很明確:給 DOI,依序走合法可用的路徑抓全文 PDF;如果都失敗,就印出圖書館 resolver link 讓使用者手動處理。
核心價值:這不是 Sci-Hub 替代品,而是把「你本來就有資格走的路」自動化:Open Access → 出版社官方文字探勘 / TDM API → 自己機構的圖書館 proxy → 手動 resolver。
Threads 貼文主張
- 很多人以為 AI 讀論文卡在 AI,其實卡在權限、出版社與圖書館。
- paper-fetch 補上論文流程最後一塊:DOI in,PDF out。
- 先試開放取用,再試出版社官方開放的文字探勘 API;都不行才用自己的圖書館帳號,抓原本就有訂閱的期刊。
- 沒有 Sci-Hub,每條路都是使用者本來有資格走的。
- 圖書館登入層每家醫院/機構不同,所以 repo 保留成可由 AI 協助接上的設定層。
- 作者補充:這是整套論文學習器的一段,可銜接 paper-radar discovery、PDF 下載、論文品質/內容分析與學習小卡。
GitHub 驗證
| 項目 | 結果 |
|---|
| Repo | drpwchen/paper-fetch |
| 描述 | Publisher-aware full-text PDF fetcher — DOI in, PDF out via OA → publisher TDM APIs → institutional proxy。 |
| License | MIT |
| 語言 / 執行 | Python 3.10+;README 提供 pip install -r requirements.txt 與 python paper_fetch.py DOI out.pdf。 |
| 路徑設計 | Unpaywall / Semantic Scholar / OA locations / PMC / Europe PMC、Elsevier/Wiley/Springer TDM API、EZproxy/NetScaler 類 institutional proxy、SFX/OpenURL resolver。 |
route ladder:為什麼這設計合理
- Open Access 優先:先用 Unpaywall、Semantic Scholar openAccessPdf、PMC/Europe PMC 或 repository landing page 的 PDF metadata。這一層不需要機構權限。
出版社官方 TDM API:例如 Elsevier、Wiley、Springer 官方 text-mining endpoints;需要自己註冊 key,但路徑是被授權的。自己的機構 proxy:若醫院、學校、公司本來有訂閱,透過自己的帳號與圖書館遠端授權走 proxy。手動 resolver:若自動路徑都失敗,輸出圖書館 resolver / OpenURL link,不假裝一定能下載。實作上最重要的兩個細節
1. 驗證 PDF magic bytes
README 特別提醒不要只信 Content-Type,因為 paywall、Cloudflare 或登入頁可能回 200 text/html,看起來成功但不是 PDF。要檢查 %PDF magic bytes。
2. 先確認 entitlement
路由失敗不一定是程式壞,也可能是機構根本沒有訂該篇。README 把 holdings 檢查列為昂貴錯誤來源。
對 AI 論文工作流的意義
AI 論文工具常把焦點放在摘要、問答、critical appraisal,但如果 PDF 來源不穩,後面全部會變成人工補洞。paper-fetch 的價值是把 discovery → download → reading 之間的 download step 模組化,讓後續 agent 可以穩定接上。
| 階段 | 可能工具 | 任務 |
|---|
| Discovery | paper-radar | 從 journal / PubMed feeds 找候選論文並打分。 |
| Download | paper-fetch | DOI → PDF,走合法 route ladder。 |
| Reading | claude-paper-tools | paper review、digest、品質分析、學習卡。 |
導入 caveat
- 機構 proxy / 圖書館登入不可能一套吃全部,需要為自己的醫院/學校/公司調整。
- 出版社 TDM API 通常需要 key、條款與 rate limit;不能假設等同一般下載權。
- 不要把它包裝成 paywall bypass;內部文件要清楚寫明只走合法授權。
- 若要交給 AI agent 接機構登入,必須把帳密/SSO/MFA 邊界與 secrets storage 設計好。
- PDF 下載成功後仍要保留 DOI、來源 route、timestamp、授權/取得方式,以便審計。
Kate 判斷
這篇對 Allen 的價值很高,因為它不是單篇論文工具,而是一個可產品化的 workflow component:把 DOI-to-PDF 變成有 fallback、有合規邊界、有審計資訊的模組。若未來要做 AI 研究助理或醫療/學術 paper agent,這段比摘要 prompt 更關鍵。