robots.txt 生成器

robots.txt 生成器

配置爬虫分组、路径规则和 Sitemap 声明。

robots.txt 内容

User-agent: *
  • 尚未声明 Sitemap URL。

搜索引擎抓取控制

什么是 robots.txt?

robots.txt 位于网站根目录,用于告诉遵守 Robots Exclusion Protocol 的爬虫哪些路径可以或不应抓取。规则按 User-agent 分组,并可声明 Sitemap 地址。

robots.txt 不是访问控制,也不能可靠阻止页面进入索引。敏感内容必须通过身份验证保护;需要移除搜索结果时,应结合 noindex、删除状态或搜索平台工具。

可配置规则

UA

多爬虫分组

支持通配爬虫、Googlebot、Bingbot、GPTBot 与自定义 User-agent。

RULE

Allow / Disallow

按组维护允许和禁止路径,识别无效格式与全站屏蔽。

MAP

Sitemap 声明

添加一个或多个绝对 Sitemap URL,并自动去重。

为什么要谨慎生成 robots.txt?

一条过宽的 Disallow 可能阻断整个网站、CSS/JS 或重要页面抓取,而无效语法可能被爬虫直接忽略。

集中管理抓取范围

为后台、搜索参数和低价值路径设置明确的抓取边界。

避免危险规则

对全站屏蔽、无效路径、重复分组和不受支持指令给出提示。

同步 Sitemap 入口

在同一文件中声明正式 Sitemap,帮助爬虫发现 URL 清单。

robots.txt 生成器如何工作?

所有输入只在浏览器本地处理,不请求目标网站,也不保存配置。

  1. 01

    创建爬虫分组

    选择常见 User-agent 或填写实际爬虫名称。

  2. 02

    填写路径规则

    分别添加 Allow 与 Disallow,按最长匹配规则组织。

  3. 03

    声明 Sitemap

    添加完整 HTTPS Sitemap 地址并去重。

  4. 04

    检查并发布

    复制或下载文件,发布到域名根目录 /robots.txt。

robots.txt 生成常见问题

Disallow 能阻止页面被收录吗?

不一定。被其他页面链接的 URL 仍可能以无摘要形式出现。需要阻止索引时,应允许抓取并返回 noindex,或移除页面。

可以用 robots.txt 保护后台吗?

不能。robots.txt 是公开文件,任何人都能看到规则;后台必须使用登录、权限和网络控制保护。

Google 支持 Crawl-delay 吗?

Googlebot 不支持 robots.txt 中的 Crawl-delay。抓取速率应通过服务器性能、Google Search Console 或响应状态管理。

Allow 和 Disallow 冲突时怎么办?

主流爬虫通常采用匹配长度更长的规则;相同长度时 Allow 常优先,但应避免依赖模糊冲突。

robots.txt 应放在哪里?

必须放在协议与主机对应的根目录,例如 https://example.com/robots.txt。子目录中的同名文件不会控制整个站点。