XML Sitemap 生成器

XML Sitemap 生成器

受限抓取同站页面,筛选可索引 URL 并生成 sitemap.xml。

输入网站地址后开始生成

站点发现与索引

什么是 XML Sitemap?

XML Sitemap 是面向搜索引擎的 URL 清单,用于帮助爬虫发现站点中重要、规范且允许索引的页面。它尤其适合新站、深层页面、大型内容站和内部链接不足的页面。

Sitemap 不能强制收录,也不能替代内部链接、Canonical、robots 和页面质量。高质量 Sitemap 应只包含返回成功、可索引并属于当前站点的规范 URL。

生成范围

CRAWL

同站安全抓取

限制域名、深度、页数、超时和响应体积,拒绝内网地址。

INDEX

索引信号过滤

排除错误状态、noindex、非规范页面和 robots 禁止路径。

XML

规范 XML 输出

输出 UTF-8 urlset,可复制或下载 sitemap.xml。

为什么要生成干净的 Sitemap?

把重定向、404、noindex 或重复 URL 放进 Sitemap 会浪费抓取资源,并向搜索引擎发送矛盾信号。

加快重要页面发现

集中声明站内可索引 URL,帮助爬虫更快发现新页面和深层页面。

减少索引冲突

过滤明显不应提交的状态码、noindex、非规范和受限地址。

保持发布可控

限制抓取范围并展示跳过原因,站长可以在提交前复核清单。

Sitemap 生成器如何工作?

工具从一个公开入口开始,只遍历同源 HTML 链接;结果短时缓存,不建立数据库历史。

  1. 01

    校验入口

    规范化网址,解析公网 IP,并拒绝本机、内网和保留地址。

  2. 02

    受限同站遍历

    按设置的页数与深度并发抓取,只加入同源 HTTP/HTTPS 页面。

  3. 03

    筛选索引信号

    检查状态码、内容类型、noindex、Canonical 和 robots 规则。

  4. 04

    生成 XML

    去重并转义 URL,输出可复制或下载的 sitemap.xml。

XML Sitemap 生成常见问题

Sitemap 能保证页面被收录吗?

不能。Sitemap 只帮助发现 URL,是否收录仍取决于可抓取性、规范信号、内容质量和搜索引擎判断。

为什么工具不自动添加 changefreq 和 priority?

主流搜索引擎通常忽略这两个字段;虚构频率和优先级没有收益,保持 URL 清单准确更重要。

为什么没有给所有 URL 添加 lastmod?

lastmod 必须反映页面真实的重大更新时间。工具不会用抓取时间冒充内容更新时间。

大型网站应该如何生成 Sitemap?

超过 50,000 个 URL 或 50MB 时应拆分多个 Sitemap,并使用 Sitemap Index 管理。大型站点更适合从 CMS 或数据库生成。

生成结果会保存吗?

不会写入业务数据库。服务器仅使用短时缓存降低重复抓取压力,生成结果保留在当前页面。