robots.txt 產生器與測試
重點摘要:想擋 AI 訓練又保留搜尋曝光,可在 robots.txt 封鎖 GPTBot、ClaudeBot、Google-Extended、CCBot 等 8 個訓練爬蟲,其他爬蟲維持 Allow: /。比對依 RFC 9309:最長相符規則優先,長度相同時 Allow 優先。
1. 產生
2. 測試規則
3. 檢查任何網站
比對規則依 RFC 9309 Robots Exclusion Protocol:最長相符的規則優先,長度相同時 Allow 優先;支援 * 與 $。
常見問題
如何封鎖 AI 訓練爬蟲但保留搜尋曝光?
選「封鎖 AI 訓練、保留搜尋曝光」模式,本站會對 GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、CCBot、meta-externalagent、Bytespider、Amazonbot 寫入 Disallow: /,其他爬蟲(Googlebot、bingbot 等)維持允許,也不影響 OAI-SearchBot 等 AI 搜尋爬蟲。
robots.txt 的 Allow 和 Disallow 衝突時聽誰的?
依 RFC 9309,最長相符的規則優先;如果兩條規則長度相同,Allow 優先。規則路徑支援 * 萬用字元與 $ 結尾符號,本站的測試工具會顯示實際命中的規則。
為什麼我在 User-agent: * 寫的 Disallow 對 AI 爬蟲沒效?
因為被點名的爬蟲只看自己的區塊,不會再套用 User-agent: * 的規則。如果你為 GPTBot 等寫了專屬區塊,想擋的路徑要在那個區塊裡另外列出。
robots.txt 能擋住 ChatGPT-User 嗎?
不一定。ChatGPT-User、Google-Agent 屬使用者觸發的擷取,依官方說明不一定遵守 robots.txt;需要硬性封鎖,應改用防火牆(WAF)。
封鎖所有 AI 爬蟲會有什麼影響?
封鎖 OAI-SearchBot、Claude-SearchBot、PerplexityBot 後,你的網站不會出現在 ChatGPT、Claude、Perplexity 搜尋的引用來源。只想避免內容被拿去訓練的話,封鎖訓練爬蟲就夠了。