robots.txt 检测

robots.txt 检测

检查网站抓取规则、禁止路径和站点地图声明。

示例: 工具会自动请求网站根目录的 /robots.txt,结果仅显示在当前页面。默认测试 Googlebot 访问该路径是否被允许。

robots.txt 检测结果

尚未开始检测

输入网站地址并选择要测试的路径,然后点击“开始检测”。

ROBOTS.TXT SEO

什么是 robots.txt 检测?

robots.txt 是网站根目录中的纯文本文件,用来向搜索引擎爬虫表达哪些路径可以抓取、哪些路径应当避开。它是抓取提示,不是访问权限控制,也不会阻止有意绕过规则的请求。

本工具会请求目标站点的 /robots.txt,解析 User-agent、Allow、Disallow、Crawl-delay 和 Sitemap,并用 Googlebot 模拟判定你指定的路径是否会被规则禁止。

User-agent

指定接收规则的爬虫分组。

Allow / Disallow

控制遵守规则的爬虫可以抓取哪些路径。

Sitemap

指向 XML 站点地图,帮助爬虫发现网址。

为什么站长需要检查 robots.txt?

规则写错、路径过度禁止或 sitemap 地址失效,都可能让搜索引擎无法发现和抓取重要页面。上线改版、迁移域名和更换 CMS 后,robots.txt 应当作为 SEO 基础项重新核对。

避免误封重要页面

快速确认首页、产品页和文章路径没有被 Disallow 规则意外挡住。

发现规则冲突

比较 Allow 与 Disallow 的最长匹配结果,定位看似开放、实际被禁止的路径。

核对站点地图入口

检查 robots.txt 中声明的 Sitemap 地址是否为有效的 HTTP 或 HTTPS URL。

工具是如何工作的?

检测只读取公开的 robots.txt,不会修改网站文件,也不会写入历史数据库。

  1. 01

    规范化网站地址

    提取域名和协议,并固定请求根目录的 /robots.txt。

  2. 02

    安全读取文件

    解析目标 IP,拒绝内网地址,并限制重定向、超时和响应大小。

  3. 03

    解析抓取规则

    按 User-agent 分组识别 Allow、Disallow、Crawl-delay 与 Sitemap。

  4. 04

    判定测试路径

    使用 Googlebot 对指定路径应用最长匹配规则,并展示诊断与修改建议。

如何理解检测结果?

文件状态、规则解析和路径判定分别表示不同层面。404 代表未找到 robots.txt,不等同于网站无法访问;查询异常也不能直接说明规则错误。

已找到

文件成功返回 HTTP 响应,并已完成解析。

未找到

未找到根目录文件;这不代表网站无法访问。

请求异常

超时或服务器错误需要重试,不能直接判断规则。

robots.txt 检测常见问题

robots.txt 应该放在哪里?

它必须位于网站主机的根目录,例如 https://example.com/robots.txt。放在 /blog/robots.txt 等子目录不会成为整个主机的标准抓取规则。

Disallow: / 会让网站从搜索结果消失吗?

它会阻止遵守该规则的爬虫抓取页面,但搜索引擎仍可能通过外部链接知道 URL。要控制是否进入索引,还应使用 noindex 等页面级信号,并确保爬虫能够访问页面读取它。

Allow 和 Disallow 同时匹配时怎么处理?

主流爬虫通常使用匹配路径更长的规则;长度相同时 Allow 优先。本工具按这一常见规则对 Googlebot 给出路径判定。

robots.txt 可以代替登录或防火墙吗?

不可以。robots.txt 是公开的抓取提示,不能保护敏感数据。需要访问控制时应使用认证、权限策略或服务器防火墙。

为什么 Sitemap 不一定要写在 robots.txt?

站点地图也可以通过 Search Console 等站长平台提交。写在 robots.txt 中有助于爬虫自动发现,但地址必须是完整的绝对 URL。