AI 流量不是只有爬蟲:從 GPTBot、OAI-SearchBot 到 ChatGPT-User 與 AI referral 的五類辨識框架
AI 網站流量應拆成訓練爬蟲、搜尋索引爬蟲、使用者觸發的即時抓取、AI agent 代理瀏覽,以及 AI 答案推薦入站五類。不同類型要用 server log、CDN/WAF、robots.txt、GA4 與前端事件交叉辨識,不能只看 GA4 或只看 User-Agent。
代表例子包含 GPTBot、ClaudeBot、Bytespider 等。這類流量的重點不是當下帶來訪客,而是內容是否被納入模型訓練或資料蒐集流程。通常要看 server access log、CDN log、Cloudflare / WAF bot event 與 robots.txt 設定。
代表例子包含 OAI-SearchBot、PerplexityBot。OpenAI 官方文件說明,網站可以允許 OAI-SearchBot 以出現在 search results,同時禁止 GPTBot 用於 foundation model training;Perplexity 官方也把 PerplexityBot 定位為 surfaced and linked websites in search results。
代表例子包含 ChatGPT-User、Perplexity-User。OpenAI 文件指出 ChatGPT-User 是使用者在 ChatGPT / Custom GPTs 中觸發特定動作時可能造訪網頁,不是自動網路爬取;Perplexity-User 也被描述為支援使用者問題時的頁面造訪。
代表場景包含 ChatGPT Agent、Operator 類瀏覽器代理、Claude Computer Use。這類流量可能不只是 GET 頁面,而是登入、點擊、填表、捲動、比較商品或走完整流程;辨識要看 session 行為、前端事件、bot fingerprint、WAF 記錄與異常互動節奏。
這是最像傳統行銷漏斗的 AI 流量:使用者在 ChatGPT、Perplexity、Claude、Copilot 等答案中看到連結並點進網站。GA4 可能看到 referral,也可能因 referer 遺失而被歸進 Direct / none,因此 Direct 流量突然成長不一定真的代表使用者直接輸入網址。
| 類型 | 代表 User-Agent / 來源 | 主要觀察位置 | 容易誤判的地方 |
|---|---|---|---|
| 訓練爬蟲 | GPTBot、ClaudeBot、Bytespider | Server log、CDN、WAF、robots.txt | 不等於有人進站,也不等於當下被 AI 答案引用。 |
| 搜尋索引爬蟲 | OAI-SearchBot、PerplexityBot | Server log、bot IP、索引抓取頻率 | 和訓練爬蟲不同;可以允許搜尋索引但禁止訓練。 |
| 即時抓取 | ChatGPT-User、Perplexity-User | Server log、單頁突發請求、官方 published IP | 看起來像 bot,但背後通常是某個使用者問題觸發。 |