阻止AI爬取:用robots.txt和ai.txt保护你的网站
AI爬虫现在大规模爬取网络。学习如何用 robots.txt、ai.txt 和服务器规则阻止AI爬取——以及什么时候不该阻止。
💡 你将学到
AI爬虫现在大规模爬取网络。学习如何用 robots.txt、ai.txt 和服务器规则阻止AI爬取——以及什么时候不该阻止。
GPTBot、ClaudeBot、PerplexityBot 以及几十种 AI 爬虫每天访问你的服务器——有的礼貌,有的猛吃带宽。阻止AI爬取是一个政策决策,有三个杠杆:robots.txt、ai.txt 和服务器级规则。
三个杠杆
1. robots.txt:用 Disallow 屏蔽特定 AI 爬虫(GPTBot、Claude-Web、PerplexityBot、Google-Extended)。标准做法,守规矩的爬虫会遵守。2. ai.txt(2025+ 新标准):机器可读文件,声明 AI 爬虫可以索引什么——更年轻,AI 搜索引擎认它。3. 服务器规则:nginx 或 Cloudflare 封禁无视 robots.txt 的滥用爬虫,按 User-Agent 限速。
什么时候别封:如果你想要 AI 搜索曝光(Perplexity、ChatGPT Search 引用),全封等于从 AI 答案里消失。很多网站现在放行 Google-Extended 和 PerplexityBot、屏蔽其余。微妙之处:全封省带宽但损失 AI 引荐流量——先想清楚 AI 搜索是否给你带来访客。
对比
| 爬虫 | 屏蔽? | 原因 |
|---|---|---|
| GPTBot | 可选 | OpenAI 训练 + 搜索 |
| Claude-Web | 可选 | Anthropic 训练 |
| PerplexityBot | 可选 | AI 搜索引用 |
| Google-Extended | 慎思 | GEO 可见性 |
常见问题
问:屏蔽 AI 爬虫会影响 Google 排名吗?
答:不会——Google-Extended 与主 Googlebot 索引分离。屏蔽训练爬虫不影响正常搜索排名。
问:无视 robots.txt 的爬虫怎么办?
答:服务器级封禁:nginx location 规则或 Cloudflare 机器人管理,按 User-Agent 限速。
