CrawlerControl
robots.txt · 爬虫模拟器

CrawlerControl

检查每个机器人可以抓取哪些 URL,找出决定访问的确切规则,并在发布之前下载更正的 robots.txt。

适用于 Googlebot、GPTBot 和其他爬虫的免费 robots.txt 模拟器,具有冲突、获胜规则和规范化文件。

无需账户本地处理假设透明

01 · 输入数据

粘贴您的 robots.txt 并尝试一条路线

编辑假设并立即查看结果。

该文件在本地读取。
不要粘贴秘密; robots.txt 是公开的。
没有发出网络请求。
该记录故意简短且有版本。

02 · 结果

准入、获胜规则和冲突

本地计算已完成

结果已根据您的数据更新

该场景已使用可见数据重新计算。在使用或下载结果之前查看指标、详细信息和限制。

DISALLOW决定
3团体
1巧合
用户代理经过测试
Google-Extended
本地路线
/training/private/report.html
获胜规则
disallow:/training/
冲突
1
  • / 中存在冲突的允许/禁止规则。
  • robots.txt 针对合作爬虫;它不进行身份验证,不保护内容,也不保证取消索引。

方法

工作原理

  1. 分隔用户代理组和允许/禁止规则。
  2. 选择最具体的组并应用最长的路径匹配。
  3. 显示获胜规则、警告和可下载的标准化 robots.txt。
先了解,再决定

何时使用

使用场景

  • 在发布 robots.txt 之前审核更改。
  • 解释为什么允许或阻止某条路线。
  • 发现群体外规则和基本矛盾。
实用示例

限制

来源与范围

robots.txt 不是身份验证、安全或取消索引命令。该模拟器实现了 RFC 9309 的实用子集,并且不查询远程 URL。

隐私设计

数据保留在此设备上

工具在浏览器中计算并创建文件,无需账户,也不会将输入发送给 Chapa Lab。

隐私