CrawlerControl
产品指南

工作原理

检查每个机器人可以抓取哪些 URL,找出决定访问的确切规则,并在发布之前下载更正的 robots.txt。

方法

  1. 01

    分隔用户代理组和允许/禁止规则。

  2. 02

    选择最具体的组并应用最长的路径匹配。

  3. 03

    显示获胜规则、警告和可下载的标准化 robots.txt。

输入数据

粘贴您的 robots.txt 并尝试一条路线

编辑假设并立即查看结果。

robots.txt的内容
不要粘贴秘密; robots.txt 是公开的。
本地路线
没有发出网络请求。
用户代理
该记录故意简短且有版本。

结果

准入、获胜规则和冲突

该场景已使用可见数据重新计算。在使用或下载结果之前查看指标、详细信息和限制。

  • 用户代理经过测试
  • 本地路线
  • 获胜规则
  • 冲突

责任范围

来源与范围

robots.txt 不是身份验证、安全或取消索引命令。该模拟器实现了 RFC 9309 的实用子集,并且不查询远程 URL。

试用工具