載入中...
載入中...
Threads 整理十個適合「爬資料餵 AI」的開源工具;本文用 GitHub metadata / license 做現實校正,把 Firecrawl、Crawl4AI、Browser-use、Crawlee、Scrapy、MarkItDown、Scrapling、scrcpy、AutoScraper、curl-impersonate 分成 RAG 擷取、瀏覽器自動化、工業爬蟲、文件轉 Markdown、App-only 資料與反 bot 請求指紋六類。
Threads 分享把 x.com URL 改成 xcancel.com,可讓 AI 更容易讀公開 X tag、list、推文並做趨勢摘要。查證 XCancel about page 可回 200,HTML metadata 顯示 Nitter 類 frontend;但搜尋/使用者頁可能回 503,因此它適合當免登入、免 JS 的快速讀取 fallback,不適合作為穩定 API、大量爬取或正式產品資料源。正式需求仍應評估 X 官方 API / Hosted X MCP。
Threads 實測 Scrapling 與 TinyFish。Scrapling 是自適應 Python 爬蟲框架,適合長期維護 selector 與 crawler;TinyFish 則提供 Search / Fetch / Agent / Browser API,適合 AI agent 的即時搜尋與全文擷取。重點是不要迷信反爬,蝦皮等高風控平台不該硬幹。
Obscura 的真正看點,不是它想『殺死 Chrome』,而是它在挑戰一個更根本的假設:AI agent 與大規模 scraping,是否真的還需要綁著一整顆笨重的 Headless Chrome 才能運作。