大部分網站處理 AI 爬蟲只有兩個選項:全開或全擋。但訓練爬蟲跟即時引用爬蟲的意圖完全不同——GPTBot、ClaudeBot 把內容拿去訓練模型,引不引用只是弱信號;使用者在 ChatGPT、Perplexity 問問題的當下,agent 是即時抓你的網站當回答來源,擋掉這批等於把自己從 AI 推薦池裡拿掉。
常見的設錯是漏掉一半:擋了訓練爬蟲卻忘記 ChatGPT-User、PerplexityBot 這類即時引用的 user-agent,結果訓練語料的長期價值沒拿到,當下的引用機會也沒了,兩頭空。更差的是對 AI 爬蟲吐假頁面想矇混——AI 廠商已在偵測這種手法,一旦命中就永久標記為低品質網站。
IETF 還在演進的 Content-Signal 提案想解決的正是這種粗糙的二分法——把搜尋索引、AI 即時引用、AI 訓練三種用途拆開分別表態。詳見 geoweb.tw。