工具介绍
robots.txt 是放在网站根目录的纯文本文件,告诉爬虫网站哪些部分可以访问、哪些不可以。谷歌、必应等搜索引擎收录时会遵守它;2026年它还是网站表态"不允许内容被用于训练AI模型"的标准做法,通过 GPTBot、CCBot、Google-Extended 等专门的爬虫名称来实现。
语法写对很重要——一个禁止路径写错,可能意外把整个网站挡在搜索引擎之外;AI屏蔽规则如果位置不对,也可能根本没起到屏蔽作用。本工具为每种场景生成语法正确的结果。
Robots 排除协议自 1994 年起作为非正式约定沿用了近三十年,直到 2022 年才正式标准化为 RFC 9309——本生成器输出的规则(User-agent、Disallow、Allow,外加 Sitemap 扩展)都遵循该规范。
为什么使用它?
- 专门的AI爬虫屏蔽预设,覆盖 GPTBot、ChatGPT-User、CCBot、Google-Extended、ClaudeBot、Bytespider、anthropic-ai,同时明确保留搜索引擎访问权限。
- 自定义禁止路径,适用于不想让任何爬虫看到的内容。
- Sitemap 地址字段——一个小改动,能帮搜索引擎更快发现你的页面。
- 每次都是正确语法——不会因为手误把整站误封。
- 免费、即时,直接下载文件或复制文本。
使用方法
- 选择预设:允许全部、禁止全部、或只屏蔽AI爬虫。
- 按需添加自定义禁止路径,每行一条(比如 /admin/)。
- 按需填写 sitemap 地址。
- 点"复制"或"下载",把文件上传到网站根目录,命名为 /robots.txt。
示例
输入
预设:屏蔽AI爬虫,保留搜索引擎。Sitemap: https://example.com/sitemap.xml输出
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
...
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml每个AI爬虫都有单独的屏蔽规则,末尾的通配规则则保留了正常搜索引擎的访问权限。
这个爬虫该不该屏蔽?
不是所有爬虫作用都一样——屏蔽错了对象,可能把搜索流量也一起切断,而不只是拒绝AI训练。
| 爬虫 | 作用 | 什么情况该屏蔽 |
|---|---|---|
| Googlebot、Bingbot | 为搜索结果收录你的网站 | 永远不要屏蔽——挡了这两个等于直接退出谷歌/必应搜索。 |
| GPTBot、ChatGPT-User | OpenAI的爬虫——GPTBot用于训练模型,ChatGPT-User是用户让ChatGPT去抓某个页面时用的 | 不想内容被用于AI训练时屏蔽GPTBot;但ChatGPT-User是响应用户主动分享的链接去抓页面,属于不同情况,有些网站会选择放行。 |
| Google-Extended | 控制谷歌是否把你的内容用于 Gemini/AI 训练——和 Googlebot 的搜索收录是分开的独立开关 | 想继续被谷歌搜索收录,但不想内容用于谷歌AI训练时——这个指令正好只挡AI训练,不影响排名。 |
| CCBot、Bytespider、anthropic-ai、ClaudeBot | 分别是 Common Crawl(很多AI数据集的数据来源)、字节跳动、Anthropic 的爬虫 | 和 GPTBot 同样的逻辑——不想内容进入AI训练数据集就屏蔽。 |
常见问题
robots.txt 真的能阻止AI用我的内容吗?
它靠的是自觉遵守——正规AI公司的爬虫确实会遵守(这正是 GPTBot、CCBot 等专门命名、有文档说明的爬虫存在的意义,就是让网站可以选择退出)。但它拦不住不遵守规则的爬虫,对屏蔽之前已经抓取过的内容也没有追溯效力。
屏蔽AI爬虫会影响谷歌/必应的搜索排名吗?
不会——AI爬虫屏蔽预设只针对指定的AI爬虫,末尾保留了对所有其他爬虫的"Allow: /"通配规则,Googlebot 和 Bingbot 不受影响。
robots.txt 文件放在哪里?
放在域名根目录,确保能通过 yourdomain.com/robots.txt 直接访问——不能放在子文件夹里。大多数网站托管平台和静态站点生成器都有专门的根目录/public目录用来放这个文件。
Sitemap 那一行是干什么的?
它指向你的 sitemap.xml,列出网站所有可收录页面。这一行是可选的,但通常建议加上——多写一行,能加快新页面被发现的速度。
自定义禁止路径能和AI屏蔽预设一起用吗?
可以——AI屏蔽预设会先加上AI爬虫的屏蔽规则,然后把你的自定义禁止路径(如果有)应用在仍然保留搜索引擎访问的通配规则下。