AI 知識庫資料擷取工具棧:Firecrawl、Crawl4AI、Browser-use 到 Scrapy 的十種分工
Threads 整理十個適合「爬資料餵 AI」的開源工具;本文用 GitHub metadata / license 做現實校正,把 Firecrawl、Crawl4AI、Browser-use、Crawlee、Scrapy、MarkItDown、Scrapling、scrcpy、AutoScraper、curl-impersonate 分成 RAG 擷取、瀏覽器自動化、工業爬蟲、文件轉 Markdown、App-only 資料與反 bot 請求指紋六類。
AI Data Ingestion / Crawling / RAG
不要把「爬資料餵 AI」都當成自己刻爬蟲:工具要按資料來源與風險分層
WhiteBoardy 這則 Threads 把十個常見開源工具放在一起:Firecrawl、Crawl4AI、Browser-use、Crawlee、Scrapy、MarkItDown、Scrapling、scrcpy、AutoScraper、curl-impersonate。這份清單的價值不是「全部安裝」,而是幫 AI 知識庫 / RAG / agent 資料擷取建立一個工具分工地圖。
Threads 原始清單
| # | 工具 | 作者說法 | 適合場景 |
|---|---|---|---|
| 1 | Firecrawl | 指一個網站,整站爬完,JavaScript 也會渲染,回傳 AI 可讀資料。 | RAG / 文件站擷取 / API-first crawler。 |
| 2 | Crawl4AI | 把網頁轉成 LLM-friendly Markdown,不用 API key / 帳號。 | 自架、低成本、Markdown-first 擷取。 |
| 3 | Browser-use | 讓 AI 像真人操作瀏覽器,會點、滾、登入、填表。 | agent browser automation / web task execution。 |
| 4 | Crawlee | 代理、重試、瀏覽器指紋、排隊都包好。 | 工程化 crawling framework。 |
| 5 | Scrapy | 十幾年的工業級老選擇,百萬頁等級。 | 大規模結構化 crawling。 |
| 6 | MarkItDown | Microsoft 做的 PDF / Office / HTML / image 轉 Markdown。 | 企業文件 ingestion。 |
| 7 | Scrapling | 網站改版會自己適應,降低 selector 重寫。 | adaptive scraping。 |
| 8 | scrcpy | 從電腦控制 Android 手機,處理只有 App 沒網頁的資料。 | App-only / 手機 UI 驗證;不是傳統 crawler。 |
| 9 | AutoScraper | 給一個例子,自動找規律爬剩下資料。 | 簡單列表 / 重複 pattern 擷取。 |
| 10 | curl-impersonate | 讓 request 看起來像真人開 Chrome。 | 低階 HTTP 指紋相容;需注意網站 ToS。 |
GitHub 現實校正
以下是依 GitHub API 讀到的 metadata。星數只代表社群熱度,不代表 production readiness;license 才是商用、自架與客戶專案導入時必查項。
| 工具 | Repo | 主要語言 | License | GitHub 訊號 | 導入 caveat |
|---|---|---|---|---|---|
| Firecrawl | firecrawl/firecrawl | TypeScript | AGPL-3.0 | 約 155k stars;官方站 firecrawl.dev。 |