同站安全抓取
限制域名、深度、页数、超时和响应体积,拒绝内网地址。
受限抓取同站页面,筛选可索引 URL 并生成 sitemap.xml。
输入网站地址后开始生成
站点发现与索引
XML Sitemap 是面向搜索引擎的 URL 清单,用于帮助爬虫发现站点中重要、规范且允许索引的页面。它尤其适合新站、深层页面、大型内容站和内部链接不足的页面。
Sitemap 不能强制收录,也不能替代内部链接、Canonical、robots 和页面质量。高质量 Sitemap 应只包含返回成功、可索引并属于当前站点的规范 URL。
限制域名、深度、页数、超时和响应体积,拒绝内网地址。
排除错误状态、noindex、非规范页面和 robots 禁止路径。
输出 UTF-8 urlset,可复制或下载 sitemap.xml。
把重定向、404、noindex 或重复 URL 放进 Sitemap 会浪费抓取资源,并向搜索引擎发送矛盾信号。
集中声明站内可索引 URL,帮助爬虫更快发现新页面和深层页面。
过滤明显不应提交的状态码、noindex、非规范和受限地址。
限制抓取范围并展示跳过原因,站长可以在提交前复核清单。
工具从一个公开入口开始,只遍历同源 HTML 链接;结果短时缓存,不建立数据库历史。
规范化网址,解析公网 IP,并拒绝本机、内网和保留地址。
按设置的页数与深度并发抓取,只加入同源 HTTP/HTTPS 页面。
检查状态码、内容类型、noindex、Canonical 和 robots 规则。
去重并转义 URL,输出可复制或下载的 sitemap.xml。
不能。Sitemap 只帮助发现 URL,是否收录仍取决于可抓取性、规范信号、内容质量和搜索引擎判断。
主流搜索引擎通常忽略这两个字段;虚构频率和优先级没有收益,保持 URL 清单准确更重要。
lastmod 必须反映页面真实的重大更新时间。工具不会用抓取时间冒充内容更新时间。
超过 50,000 个 URL 或 50MB 时应拆分多个 Sitemap,并使用 Sitemap Index 管理。大型站点更适合从 CMS 或数据库生成。
不会写入业务数据库。服务器仅使用短时缓存降低重复抓取压力,生成结果保留在当前页面。