robots.txt 三十年只有一種語法:一支爬蟲不是全允許就是全禁止。但 AI 時代的爬蟲意圖分裂成三種:排名用的傳統搜尋、即時引用的 AI 引擎、訓練下一代模型的資料蒐集。品牌想要「搜尋全開、AI 引用歡迎、訓練語料不給」的精細組合,舊協議做不到,只能整包開放或整包擋掉。
IETF 在 2025 年提出 Content-Signal 協議,讓同一份設定檔能對三種意圖分別表態,不再綁在一支開關上。作者判斷這是過渡期協議:截至 2026 年 4 月,Google 未支援,OpenAI、Bing、Anthropic 部分遵守,Perplexity 在試驗——但「做了不會錯」,支援的廠商照辦,不支援的仍退回既有規則。geoweb.tw 自家選擇是歡迎引用、不開放訓練。
在意內容被拿去訓練、又不想放棄 AI 引用曝光的品牌——尤其是 B2B 站或媒體出版——這談的是該不該開放訓練語料的判斷依據,不是設定教學。詳見 geoweb.tw。