Scrapling 與 TinyFish:AI Agent 的資料擷取堆疊要分成搜尋、Fetch、瀏覽器與爬蟲框架
Threads 實測 Scrapling 與 TinyFish。Scrapling 是自適應 Python 爬蟲框架,適合長期維護 selector 與 crawler;TinyFish 則提供 Search / Fetch / Agent / Browser API,適合 AI agent 的即時搜尋與全文擷取。重點是不要迷信反爬,蝦皮等高風控平台不該硬幹。
這則 Threads 實測兩個給 AI agent 用的 web data 工具:Scrapling 與 TinyFish。原文的實測結論很實用:Scrapling 確實很強,但不要硬幹蝦皮;TinyFish 則像免費版 Tavily + Fetch,適合新聞、研究與內容推送。
我另外核對了 Scrapling GitHub / PyPI / README,以及 TinyFish 官方網站與第三方工具頁,整理如下。
1. Scrapling:自適應爬蟲,不是萬能反爬神器
GitHub:https://github.com/D4Vinci/Scrapling Docs:https://scrapling.readthedocs.io/en/latest/ PyPI:https://pypi.org/project/scrapling/
Scrapling 官方定位是 adaptive Web Scraping framework,可以從單頁 request 擴展到 full-scale crawl。它的主要賣點有三個:
- Parser 會學習網站變化,當頁面改版時自動重新定位元素。
- Fetchers 宣稱可處理 Cloudflare Turnstile 等 anti-bot 系統。
- Spider framework 支援 concurrent、multi-session crawl、pause/resume、自動 proxy rotation。
官方 README 範例裡最關鍵的概念是 adaptive selector:
from scrapling.fetchers import StealthyFetcher
StealthyFetcher.adaptive = True
p = StealthyFetcher.fetch('https://example.com', headless=True, network_idle=True)
products = p.css('.product', auto_save=True)
products = p.css('.product', adaptive=True)
它不是只比 BeautifulSoup 多一點語法糖,而是想解決爬蟲長期維護最痛的問題:網站 class name、DOM 結構、selector 一改,爬蟲就壞掉。Scrapling 用相似度、文字、regex、adaptive selection 來提高抗改版能力。
GitHub metadata:Python,BSD-3-Clause license,約 47k stars,topics 包含 ai-scraping、mcp、playwright、stealth、selectors、xpath、web-scraping 等。README 也有 agent-skill 與 OpenClaw Skill 入口。
2. 原文實測的重點:別把 anti-bot 當成保證通行證
原文說 Scrapling 在幾個有反爬機制的網站上表現很好,但最後仍倒在蝦皮前面:即使加裝 530MB 潛行瀏覽器、Cloudflare 繞過、真實 Chrome,仍會不時跳驗證視窗,甚至差點封號。
這段很值得保留,因為它校正了一個常見誤解:
「支援 stealth / anti-bot / Cloudflare」不等於「可以穩定抓任何網站」。
尤其是 Shopee 這類電商平台,通常不只靠 Cloudflare,而會結合帳號風控、行為軌跡、裝置指紋、登入態、IP reputation、頻率限制、風險模型。硬幹只會提高封號風險。
對 BigIntTech 的做法應該是:
- 公開網頁、新聞、文件、產品頁:可以優先嘗試 Scrapling / browser automation。
- 高風控平台如蝦皮、銀行、社群登入牆:不要硬繞,優先研究官方 API、商家後台匯出、合作資料源、人工授權流程。
- 需要登入的資料:必須先確認權限、頻率、資料使用範圍與帳號風險。