Security / Web Ops
Cloudflare AI Bot 三分法:Search 留著,Training 另行治理
Threads 討論 Cloudflare 將 AI Bot/自動化流量拆成搜尋、代理、訓練用途,並用 crawl-to-referral 衡量 AI 爬蟲換回多少點擊。本文整理官方 AI Crawl Control/AI Audit 脈絡、網站主該看的指標,以及 Allen KB / BigIntTech 網站的實務治理清單。
2026年8月3日2 分鐘閱讀👁 3
Threads 知識整理 · Cloudflare · AI Crawl Control
Threads 來源指出:AI 爬蟲可能大量抓取內容,卻只帶回極少點擊;Cloudflare 也把自動化流量從單純「bot」拆成更細的用途判斷。這篇的價值不是一句「SEO 結束了」,而是提醒網站主開始用 Search / Agent / Training 的框架治理爬蟲。
Matt 判斷:不要一刀切擋掉所有 bot。對內容站、公司官網、Allen KB 這類網站,Search bot 仍可能是 discoverability;Training crawler 則要看授權、頻寬成本與資料策略;Agent 型流量未來可能代表真人委託 AI 來讀網站,不能跟訓練爬蟲混在一起。
三種用途:同樣是 bot,商業意義不同
| 類型 | 目的 | 對網站主的價值 | 治理建議 |
|---|---|---|---|
| Search | 搜尋索引、摘要、推薦流量 | 仍可能帶來可追蹤入口 | 保留,但監測 crawl-to-referral |
| Agent | 代表使用者即時讀頁、比價、下單、查資料 | 可能是未來 AI agent commerce / research 的入口 | 不要急著擋,先辨識與記錄 |
| Training | 蒐集內容做模型訓練或資料集 | 對原站回流很弱,成本與授權風險高 | 預設收緊、分 bot 放行、必要時 403 |
Threads 來源的重點
- 來源主張「AI 爬蟲抓 50,000 次資料,可能才換到 1 個點擊回流」。這應視為來源/實測觀察,不是所有站通用的官方平均值。
- 作者建議到 Cloudflare 後台看 Crawl-to-referral 類指標,判斷爬蟲成本與回流是否失衡。
- 作者的策略是「搜尋留著,訓練直接擋掉」。這是可行方向,但要先注意 mixed-use crawler。
官方脈絡與可驗證事實
- Cloudflare 官方文件有 AI Audit / AI Crawl Control 與 Get started 頁面,定位是讓網站主檢視與控制 AI crawler 存取。
- Cloudflare bot 文件說明 bot 是自動化流量,不等於全部惡意;因此治理上要分辨用途與行為。
- 相關 KB 既有文章:AI 流量不是只有爬蟲:五類辨識框架,本篇是 Cloudflare 控制面與決策面補充。
BigIntTech / Allen KB 實務清單
- 看比例:AI crawler requests、bytes、origin load、crawl-to-referral、search referral 是否失衡。
- 分 bot:Googlebot/Bingbot/Applebot 這類可能 mixed-use,不要只看到 training 就全擋。
- 分內容:公開行銷頁、產品文件、KB 文章、私有 API、附件與管理路徑應採不同策略。
- 先採樣:對高流量 bot 抽樣 User-Agent、ASN、路徑、狀態碼與 bytes,避免 SPA fallback 造成誤判。