多爬虫分组
支持通配爬虫、Googlebot、Bingbot、GPTBot 与自定义 User-agent。
配置爬虫分组、路径规则和 Sitemap 声明。
robots.txt 内容
User-agent: *
搜索引擎抓取控制
robots.txt 位于网站根目录,用于告诉遵守 Robots Exclusion Protocol 的爬虫哪些路径可以或不应抓取。规则按 User-agent 分组,并可声明 Sitemap 地址。
robots.txt 不是访问控制,也不能可靠阻止页面进入索引。敏感内容必须通过身份验证保护;需要移除搜索结果时,应结合 noindex、删除状态或搜索平台工具。
支持通配爬虫、Googlebot、Bingbot、GPTBot 与自定义 User-agent。
按组维护允许和禁止路径,识别无效格式与全站屏蔽。
添加一个或多个绝对 Sitemap URL,并自动去重。
一条过宽的 Disallow 可能阻断整个网站、CSS/JS 或重要页面抓取,而无效语法可能被爬虫直接忽略。
为后台、搜索参数和低价值路径设置明确的抓取边界。
对全站屏蔽、无效路径、重复分组和不受支持指令给出提示。
在同一文件中声明正式 Sitemap,帮助爬虫发现 URL 清单。
所有输入只在浏览器本地处理,不请求目标网站,也不保存配置。
选择常见 User-agent 或填写实际爬虫名称。
分别添加 Allow 与 Disallow,按最长匹配规则组织。
添加完整 HTTPS Sitemap 地址并去重。
复制或下载文件,发布到域名根目录 /robots.txt。
不一定。被其他页面链接的 URL 仍可能以无摘要形式出现。需要阻止索引时,应允许抓取并返回 noindex,或移除页面。
不能。robots.txt 是公开文件,任何人都能看到规则;后台必须使用登录、权限和网络控制保护。
Googlebot 不支持 robots.txt 中的 Crawl-delay。抓取速率应通过服务器性能、Google Search Console 或响应状态管理。
主流爬虫通常采用匹配长度更长的规则;相同长度时 Allow 常优先,但应避免依赖模糊冲突。
必须放在协议与主机对应的根目录,例如 https://example.com/robots.txt。子目录中的同名文件不会控制整个站点。