如今,你的 `robots.txt` 文件决定了 ChatGPT、Claude、Perplexity 以及 Google 的 AI 答案能不能看见你的品牌。读完这篇你会清楚:该放行还是拦截哪些 AI user-agent、每个爬虫的可复制粘贴 `robots.txt` 配置块,以及如何在服务器日志里验证规则真的生效了。
难点在于,「把所有 AI 爬虫全拦掉」通常是错的。拦掉那些为 AI 答案供数据的爬虫,会悄悄把你从用户如今取代 Google 去读的结果里抹掉。所以目标不是砌一堵墙,而是一套有取舍的策略:欢迎会引用你的爬虫,对只拿你训练的爬虫再逐个斟酌。
核心要点
- `robots.txt` 是控制 AI 爬虫访问的首要手段,但它是自愿遵守的——守规矩的爬虫会遵从,它拦不住无视协议的抓取器。 - AI 爬虫按用途分两类:训练类(喂给模型的静态知识)和搜索/RAG 类(实时抓页面来生成答案)。两者要区别对待。 - 拦掉 `OAI-SearchBot`、`PerplexityBot` 这类搜索/RAG 爬虫,等于把自己从会标注来源的 AI 答案里删掉——直接损失可见度。 - `Google-Extended` 只管 Gemini/Vertex 的训练,它不会把你从 Google AI Overviews 里移除,后者走的是普通 `Googlebot`。 - 写了指令不等于生效。信任任何规则之前,先在服务器日志里确认爬虫的真实行为。
步骤 1:先分清两类 AI 爬虫
动手改之前,先按爬虫「拿你的页面做什么」来分类。
训练类爬虫抓内容去训练大语言模型,数据成为模型静态知识的一部分。被收录有助于「品牌 X 是什么」这类泛化回答,但不保证被引用。例如:
- `GPTBot`——OpenAI 模型训练 - `ClaudeBot` 和 `anthropic-ai`——Anthropic 模型训练 - `Google-Extended`——Gemini/Vertex AI 训练 - `Applebot-Extended`——Apple Intelligence 训练 - `CCBot`——Common Crawl,很多模型基于它的数据集训练 - `Bytespider`——字节跳动爬虫
搜索/RAG 爬虫在回答时实时抓页面,生成有出处、可引用的答案。拦掉这类才是真的把你从 AI 答案里删掉:
- `OAI-SearchBot`——OpenAI 的 ChatGPT 搜索/浏览抓取器 - `PerplexityBot`——Perplexity 的索引/回答爬虫 - `Googlebot`——同时负责渲染 AI Overviews 和 AI Mode
实操原则:对搜索/RAG 爬虫大方放行,对训练类爬虫谨慎取舍。
步骤 2:定位或创建你的 robots.txt
文件位于域名根目录:`https://yourdomain.com/robots.txt`。必须是纯文本,以 `200` 状态返回。
- 自建站点:在网站根目录新增或编辑 `robots.txt`。 - Shopify:文件自动生成,可通过主题里的 `robots.txt.liquid` 编辑。 - WordPress:通常由 SEO 插件(Yoast、Rank Math)管理一个虚拟 `robots.txt`。
每组规则以 `User-agent` 开头,后面跟 `Allow` 和 `Disallow` 路径。`Disallow: /` 拦截全部;`Allow: /`(或不写 `Disallow`)表示全部放行。
步骤 3:放行会引用你的 AI 搜索爬虫
如果目标是 GEO 可见度,就明确欢迎那些生成带引用答案的抓取器。下面这段对全站放行它们:
``` User-agent: OAI-SearchBot Allow: /
User-agent: PerplexityBot Allow: /
User-agent: Googlebot Allow: / ```
不拦这几个,是这份文件里最关键的 GEO 决定。一个拦了 `OAI-SearchBot` 的站点,无论内容多强,都不会被 ChatGPT 的带引用网页结果收进去。
步骤 4:定下对训练类爬虫的策略
这是取舍题,不是默认项。放行训练类爬虫,意味着你的品牌事实、定位、产品名会被写进模型的世界知识,有助于无提示下的品牌联想。拦掉它们,则保护专有或高价值内容不被无署名地吸收。
要全站放行训练类爬虫,什么都不用写——没有指令即默认允许。要拦掉,就加明确的拦截块:
``` User-agent: GPTBot Disallow: /
User-agent: ClaudeBot Disallow: /
User-agent: anthropic-ai Disallow: /
User-agent: Google-Extended Disallow: /
User-agent: Applebot-Extended Disallow: /
User-agent: CCBot Disallow: /
User-agent: Bytespider Disallow: / ```
关于 `Google-Extended`:它只管 Gemini 和 Vertex AI 的训练。拦掉它不会把你从 Google AI Overviews 或 AI Mode 里移除——那些走的是标准 `Googlebot`。而一旦你 disallow 了 `Googlebot`,连普通 Google 搜索也一起没了,所以别拿它当 AI 的退出开关。
步骤 5:混用放行与拦截做部分开放
多数品牌想走中间路线——让爬虫读营销页面,但挡在结算、账户、站内搜索之外。按爬虫组合路径规则:
``` User-agent: GPTBot Allow: / Disallow: /cart Disallow: /account Disallow: /search ```


