「我不想讓 AI 拿內容去訓練」,很多網站把 robots.txt 裡所有 AI 爬蟲一次砍光——這是最貴的誤會之一。同一家 AI 公司常同時派出好幾隻爬蟲,分工完全不同:一隻負責把內容吃進去訓練模型,另一隻在使用者提問當下即時抓取、引用你。一刀切下去,擋掉的往往不只是你想拒絕的那隻,還包括讓你被 AI 答案引用的那隻。
更麻煩的是,這種失誤沒有警報。傳統 SEO 排名掉了你至少感覺得到,但 AI 答案裡少了你,後台不會留下「這次曝光沒發生」的紀錄,沒有人會通知你。等到發現同業已經在 ChatGPT 被反覆提到、自己卻從沒出現過,通常已經錯過很久。
原則只有一句話:擋訓練、放行搜尋,兩件事能同時做到,差別只在分不分得清哪隻爬蟲是哪隻;頁面上的 noai 標籤和 robots.txt 的爬蟲規則,也是兩套各自獨立、都可能因設太粗而誤傷能見度的機制,且不是設一次就能收工。詳見 geoweb.tw。