User-agent
指定接收规则的爬虫分组。
ROBOTS.TXT SEO
robots.txt 是网站根目录中的纯文本文件,用来向搜索引擎爬虫表达哪些路径可以抓取、哪些路径应当避开。它是抓取提示,不是访问权限控制,也不会阻止有意绕过规则的请求。
本工具会请求目标站点的 /robots.txt,解析 User-agent、Allow、Disallow、Crawl-delay 和 Sitemap,并用 Googlebot 模拟判定你指定的路径是否会被规则禁止。
指定接收规则的爬虫分组。
控制遵守规则的爬虫可以抓取哪些路径。
指向 XML 站点地图,帮助爬虫发现网址。
规则写错、路径过度禁止或 sitemap 地址失效,都可能让搜索引擎无法发现和抓取重要页面。上线改版、迁移域名和更换 CMS 后,robots.txt 应当作为 SEO 基础项重新核对。
快速确认首页、产品页和文章路径没有被 Disallow 规则意外挡住。
比较 Allow 与 Disallow 的最长匹配结果,定位看似开放、实际被禁止的路径。
检查 robots.txt 中声明的 Sitemap 地址是否为有效的 HTTP 或 HTTPS URL。
检测只读取公开的 robots.txt,不会修改网站文件,也不会写入历史数据库。
提取域名和协议,并固定请求根目录的 /robots.txt。
解析目标 IP,拒绝内网地址,并限制重定向、超时和响应大小。
按 User-agent 分组识别 Allow、Disallow、Crawl-delay 与 Sitemap。
使用 Googlebot 对指定路径应用最长匹配规则,并展示诊断与修改建议。
文件状态、规则解析和路径判定分别表示不同层面。404 代表未找到 robots.txt,不等同于网站无法访问;查询异常也不能直接说明规则错误。
文件成功返回 HTTP 响应,并已完成解析。
未找到根目录文件;这不代表网站无法访问。
超时或服务器错误需要重试,不能直接判断规则。
它必须位于网站主机的根目录,例如 https://example.com/robots.txt。放在 /blog/robots.txt 等子目录不会成为整个主机的标准抓取规则。
它会阻止遵守该规则的爬虫抓取页面,但搜索引擎仍可能通过外部链接知道 URL。要控制是否进入索引,还应使用 noindex 等页面级信号,并确保爬虫能够访问页面读取它。
主流爬虫通常使用匹配路径更长的规则;长度相同时 Allow 优先。本工具按这一常见规则对 Googlebot 给出路径判定。
不可以。robots.txt 是公开的抓取提示,不能保护敏感数据。需要访问控制时应使用认证、权限策略或服务器防火墙。
站点地图也可以通过 Search Console 等站长平台提交。写在 robots.txt 中有助于爬虫自动发现,但地址必须是完整的绝对 URL。
继续检查页面响应、站点地图和网站基础 SEO 信号。