XML Sitemap是什么?网站地图作用、格式与提交方法详解

XML Sitemap 是网站 SEO 中常用的基础配置,可以帮助 Google 更高效地发现和抓取重要页面。本文详细讲解 XML 网站地图的格式、生成方法、提交步骤及常见错误,并说明 Sitemap 提交后仍未收录时应该从哪些方面继续排查。

Chahu 团队2026-09-075 分钟阅读

网站已经上线了一段时间,新发布的文章却迟迟没有被 Google 发现;网站改版之后新增了不少页面,Search Console 里依然看不到抓取记录;或者站点有成百上千个产品和内容页面,很难确认搜索引擎到底有没有全部找到。遇到这类问题时,除了检查内链、robots.txt 和页面本身是否允许索引,"XML Sitemap(XML网站地图)"也是一个很重要的基础配置。

XML Sitemap 可以把网站中希望搜索引擎发现的重要 URL 统一整理出来,并提供页面更新时间等信息。今天我们来具体讲清楚 XML Sitemap 是什么、网站地图有什么作用、常见格式怎么写,以及生成之后如何检查并提交给 Google。

ScreenShot_2026-09-07_100133_217.png

一、XML Sitemap是什么?

XML Sitemap 可以理解成一份专门提供给搜索引擎读取的网站 URL 清单。普通访客一般不会主动打开它,但 Google、Bing 等搜索引擎在抓取网站时,可以通过 Sitemap 更快了解网站有哪些重要页面,以及部分页面最近是否发生过更新。

常见的 Sitemap 地址一般类似:

https://www.example.com/sitemap.xml

也有一些网站会使用:

https://www.example.com/sitemap_index.xml

打开以后看到的不是普通网页,而是一段 XML 数据。例如:

<?xml version="1.0" encoding="UTF-8"?>

<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://www.example.com/</loc>
    <lastmod>2026-09-01</lastmod>
  </url>

  <url>
    <loc>https://www.example.com/blog/xml-sitemap</loc>
    <lastmod>2026-09-03</lastmod>
  </url>
</urlset>

其中几个常见标签并不难理解:

  • <urlset>:整个 Sitemap 的主体;

  • <url>:代表一个 URL;

  • <loc>:页面的完整网址;

  • <lastmod>:页面最后一次发生重要修改的时间。

按照 Sitemap 协议,XML 文件需要采用 UTF-8 编码,其中<urlset>、<url>和<loc>构成最基本的 URL Sitemap 结构。

网上一些旧教程还会经常出现:

<changefreq>daily</changefreq>
<priority>1.0</priority>

但现在做 Google SEO,没有必要把大量精力放在这两个标签上。

Google 当前明确表示,会忽略 Sitemap 中的<priority>和<changefreq>;相比之下,如果<lastmod>长期保持准确,Google可能会参考这个时间判断页面是否发生过重要更新。

所以不要为了“让 Google 多抓几次”,把所有页面都设置成:

<priority>1.0</priority>

或者每天自动修改 Sitemap 的日期。

这类操作实际意义已经很有限。

二、XML Sitemap对网站有什么作用?

XML Sitemap 最大的价值不是“提高关键词排名”,而是帮助搜索引擎发现和理解网站中的重要 URL。Google 对 Sitemap 的定义也是如此:它可以提供网站页面、视频、图片等文件的信息,以及这些内容之间的关系,帮助搜索引擎更加高效地抓取网站。实际做网站时,它主要解决以下几个问题:

1. 帮助Google发现新页面

例如一个刚上线不久的网站:

首页
├── 产品页面
├── 关于我们
├── 博客
│   ├── 文章A
│   ├── 文章B
│   └── 文章C

如果站内链接结构做得很好,Googlebot 本身也可以沿着链接逐渐发现这些页面。但如果网站很新、外链很少,或者部分新页面的内部链接入口比较深,搜索引擎可能需要更长时间才能发现。

把这些重要 URL 写入 Sitemap,相当于额外给搜索引擎提供了一份页面清单。Google也特别提到,大型网站、新网站以及拥有大量图片、视频或新闻内容的网站,更容易从 Sitemap 中受益。

2. 帮助管理大型网站

如果网站只有几十个页面,维护起来还比较简单。但电商、资讯、论坛或者大型内容网站可能拥有几十万甚至数百万个URL,这时单靠站内导航很难快速判断所有重要页面是否都被搜索引擎发现。使用 Sitemap,可以按照内容类型进行拆分:

sitemap_index.xml
│
├── post-sitemap.xml
├── page-sitemap.xml
├── product-sitemap.xml
├── category-sitemap.xml
└── image-sitemap.xml

这样不仅更容易维护,在 Search Console 中排查问题时也更清楚。

3. 提供页面更新时间

例如一篇文章原本发布日期是:2026-01-10,后来在:2026-09-04重新补充了大量正文、数据和链接,就可以更新:<lastmod>2026-09-04</lastmod>,但这里要注意,lastmod应该尽量反映真实的重要修改时间

正文更新、结构化数据调整、重要链接变化通常算实质修改;单纯把网页底部版权年份从 2025 改成 2026,并不值得更新所有页面的lastmod。这也符合 Google 目前对该标签的使用说明。

三、XML Sitemap常见格式有哪些?

网站地图并不只有一种形式,不过普通站长最常接触的还是 XML Sitemap。

1. 普通XML Sitemap

这是最常见的一种:

https://example.com/sitemap.xml

主要用于列出网站页面。

例如:

<url>
  <loc>https://example.com/product/a</loc>
  <lastmod>2026-08-28</lastmod>
</url>

XML Sitemap 的优势是扩展能力比较强,除了普通 URL,还可以提供图片、视频、新闻以及多语言页面的相关信息。

2. Sitemap Index

网站规模变大以后,通常不会把所有 URL 都塞进一个文件,而是通过 Sitemap Index 管理多个子 Sitemap。

例如:

<?xml version="1.0" encoding="UTF-8"?>

<sitemapindex xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <sitemap>
    <loc>https://example.com/post-sitemap.xml</loc>
  </sitemap>

  <sitemap>
    <loc>https://example.com/product-sitemap.xml</loc>
  </sitemap>

  <sitemap>
    <loc>https://example.com/page-sitemap.xml</loc>
  </sitemap>
</sitemapindex>

Google和 Sitemap 协议当前规定,单个 Sitemap 最多包含 50,000 个 URL,并且未压缩文件不能超过 50MB。超过其中任何一项,就应该拆分多个 Sitemap。

例如一家电商网站有 120,000 个产品 URL,可以拆成:

product-sitemap-1.xml
product-sitemap-2.xml
product-sitemap-3.xml

再通过:

sitemap_index.xml

统一管理。

3. 图片、视频和新闻Sitemap

如果网站大量依赖:

  • 商品图片;

  • 原创图片;

  • 视频内容;

  • Google News;

还可以在 Sitemap 中增加对应的信息。

不过对于普通企业站或者博客来说,没有必要一开始就把 Sitemap 做得特别复杂,先把核心页面 URL 管理好更重要。

四、哪些URL应该放进Sitemap?

这一步实际上比“Sitemap 用什么工具生成”更重要。一个比较简单的判断标准是:只把真正希望出现在搜索结果中的规范 URL 放入 Sitemap。

例如:

https://example.com/
https://example.com/product/
https://example.com/product/a
https://example.com/blog/xml-sitemap

这些都是正常的重要页面,可以放进去。

而下面这些 URL 通常就没有必要大量加入 Sitemap:

404页面
后台登录地址
测试页面
重复页面
noindex页面
301/302跳转地址
搜索结果页
大量筛选参数页
非Canonical URL

假设同一个产品可以通过两个地址访问:

https://example.com/product?id=1001

和:

https://example.com/product/1001

如果网站已经通过 canonical 明确指定:

https://example.com/product/1001

为规范版本,那么 Sitemap 也应该尽量保持一致,只提交规范 URL。

Google目前的建议也是:在 Sitemap 中优先列出真正希望出现在搜索结果中的 canonical URL。

否则很容易出现:

Canonical说A是主页面
Sitemap却一直提交B

这会给搜索引擎提供互相矛盾的信号。

五、XML Sitemap怎么生成?

如果网站页面不算特别多,其实没必要手动一条条整理 URL,也不一定要为了生成 Sitemap 专门安装插件。最方便省事的方式,是直接用chahu的XML Sitemap 生成器从网站入口开始抓取,把站内的重要页面整理出来,再生成标准的 sitemap.xml

具体使用方法:

直接打开 Chahu XML Sitemap 生成器,进入页面后,输入网站首页地址,例如:

https://www.example.com/

然后根据网站实际情况设置抓取参数,包括:最多抓取多少个 URL;抓取深度;是否保留 URL 查询参数。设置完成后开始抓取即可。Chahu 会从输入的网站入口开始遍历站内 HTML 链接,抓取范围限制在同站页面,不会把外部网站的链接一起加入 Sitemap。这样做比手动整理方便很多,尤其是网站已经有几十篇文章、产品页或者栏目页时,不需要再逐个复制网址,也能减少漏掉重要页面的情况。

六、Sitemap生成以后该做什么?

生成 Sitemap 的目的也不是单纯追求 URL 数量。网站地图里真正需要保留的,应该是网站中希望搜索引擎发现的重要页面,而不是把页面里出现过的所有链接全部塞进去。所以 Sitemap 生成完成以后,下一步先不要急着提交到 Google Search Console。最好先检查一下文件本身是否能够正常访问,避免因为路径、HTTPS、服务器或者 CDN 配置问题,导致搜索引擎根本无法读取。

1. 先确认Sitemap地址是否正确

生成完成后,可以先直接打开 Sitemap 地址,例如:

https://www.example.com/sitemap.xml

正常情况下,应该能够看到 XML 内容,而不是跳转到:404页面;网站首页;登录页面;验证页面;CDN拦截页面等等。

如果地址打不开,应该先确认 sitemap.xml 是否已经真正上传到对应目录,以及网站路由有没有把这个地址重定向到其他页面。

2. 检查HTTP状态码是否正常

Sitemap 最理想的状态是直接返回:200 OK

如果返回:301或者302,虽然部分情况下搜索引擎仍然可以继续跟随跳转,但没有必要人为增加这一层。

更值得注意的是:

403
404
500
502
503
504

这些状态码。其中 404 一般代表文件不存在或路径错误,403 更常见于服务器权限、CDN、WAF 或 Bot 防护规则,而 5xx 则通常需要继续检查服务器或者上游代理状态。

3. 可以用Chahu检查实际访问状态

如果想确认 Sitemap 在公网环境下是否能够正常访问,可以用 Chahu 对 Sitemap 地址进行一次 HTTP 或 HTTPS 检查。

例如测试:https://www.example.com/sitemap.xml

重点看几个问题:

  • URL 能不能正常打开;

  • HTTP 状态码是不是 200;

  • HTTPS 连接有没有异常;

  • 响应速度是否正常;

  • 是否存在超时;

  • 不同网络节点访问结果是否一致。

这一步对接入 CDN 或多节点的网站尤其有用。

有时候自己电脑打开 Sitemap 完全正常,但某些地区节点却返回 403、超时或者其他异常。如果只在本地浏览器里检查,很容易忽略这类问题。

4. 再看robots.txt有没有影响抓取

除了 Sitemap 文件本身,还建议顺手检查一下:

https://www.example.com/robots.txt

看看有没有因为规则写错,把重要目录或者整个网站都限制了。

如果需要,也可以在 robots.txt 中声明 Sitemap 地址:

Sitemap: https://www.example.com/sitemap.xml

这样搜索引擎在读取 robots.txt 时,也能找到网站地图的位置。

做到这里以后,再把 Sitemap 提交到 Google Search Console 会更稳妥。

简单来说,整个过程最好按照这个顺序:

生成XML Sitemap
      ↓
确认Sitemap地址
      ↓
检查HTTP状态码
      ↓
检查HTTPS和服务器访问
      ↓
检查robots.txt
      ↓
提交Google Search Console

先把访问问题排除,再进入提交和索引环节,后面遇到 Sitemap “无法获取”“读取失败”之类的问题时,也更容易判断到底出在哪里。

七、XML Sitemap怎么提交给Google?

确认 Sitemap 可以正常访问以后,就可以正式告诉 Google 文件在哪里,目前最常用的方式有两种:

方法一:Google Search Console提交

进入自己的网站资源,然后找到:

Google Search Console
        ↓
站点地图 / Sitemaps
        ↓
添加新的站点地图

输入:

sitemap.xml

或者:

sitemap_index.xml

再提交即可。

通过 Search Console 提交还有一个好处:后续可以看到 Googlebot 是否访问过 Sitemap,以及 Google 在处理文件时是否发现错误。

如果网站比较大,还可以分别提交多个 Sitemap,用于观察不同页面类型的发现和抓取情况。

例如:

/post-sitemap.xml
/product-sitemap.xml
/page-sitemap.xml

这样后续如果产品页面出现问题,不需要从十几万个 URL 中慢慢找。

方法二:在robots.txt声明Sitemap

还可以直接在网站的:

https://example.com/robots.txt

中添加:

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

如果使用 Sitemap Index,则写:

Sitemap: https://example.com/sitemap_index.xml

Google会在后续抓取 robots.txt 时发现这个 Sitemap 地址。

这里一定要使用完整绝对 URL,不要只写:

Sitemap: /sitemap.xml

更稳妥的写法是:

Sitemap: https://example.com/sitemap.xml

如果你刚修改过 robots.txt,也可以通过 Chahu 的 robots.txt 检测功能重新读取线上规则,确认 Sitemap 地址有没有写错,以及重要目录是否被意外设置了Disallow。

八、Sitemap提交失败有哪些原因?

如果 Search Console 显示 Sitemap 无法读取,不要反复删除、重新提交。先看具体问题:

1. Sitemap返回404

例如提交:

https://example.com/sitemap.xml

实际打开却显示:

404 Not Found

这种情况一般是:

  • Sitemap没有生成;

  • 地址写错;

  • 文件移动过;

  • CMS更换了 Sitemap 路径。

先找到真正的文件地址再重新提交。

2. 返回403 Forbidden

如果正常浏览网页没有问题,但 Sitemap 返回:

403

重点检查:CDN访问规则;WAF;Bot防护;IP限制;Web Server规则,尤其不要因为防爬配置太严格,把正常搜索引擎也一起挡在外面。

3. 返回5xx错误

例如:

500
502
503
504

这类问题更多指向服务器、反向代理、CDN或者后端程序。

如果偶尔能打开、偶尔报错,可以从多个地区测试 URL,看看是不是某些线路或节点存在异常。

4. XML格式错误

XML对格式要求比较严格。

例如 URL 中存在:&

需要正确做实体转义,否则有可能导致 XML 无法正常解析。

按照 Sitemap 协议,XML 中的数据值需要正确进行 entity escaping。

5. Sitemap包含大量无效URL

有时候 Search Console 显示 Sitemap 可以读取,但里面却混进大量:

404
301
noindex
重复页
非canonical页面

这种 Sitemap 即使“提交成功”,也谈不上质量高。

所以排查 Sitemap 时不要只问:Google能不能读取?

还应该问:Google读取以后,里面提供的是不是一批真正值得索引的页面?

九、Sitemap提交成功了页面还是不收录是什么原因?

这是 Sitemap 最容易被误解的地方。不少站长看到 Search Console 显示:Sitemap:成功

就会认为里面所有页面很快都应该出现在 Google。

其实不是。Sitemap主要解决的是:让Google知道URL存在

但从“发现页面”到最终进入索引,中间还有很多判断:

发现URL
   ↓
能否抓取
   ↓
HTTP状态是否正常
   ↓
robots.txt
   ↓
noindex
   ↓
Canonical
   ↓
页面内容和重复度
   ↓
网站内部链接
   ↓
页面质量
   ↓
是否进入索引

所以一个页面长期不收录时,不应该每天重新提交 Sitemap。

更值得检查的是:

  • 页面是否返回200;

  • 有没有被robots.txt阻止;

  • 是否存在noindex;

  • canonical是不是指向其他页面;

  • 内容是否重复;

  • 有没有正常内部链接;

  • 页面是否真正有独立价值。

Google也明确说明,提交 Sitemap 只是一个提示,并不保证 Google 一定下载、抓取或者索引其中的页面。这也是为什么:Sitemap提交成功,只能说明网站地图这一环节基本正常,并不代表整个SEO索引流程已经完成。

ScreenShot_2026-09-07_100228_647.png

XML Sitemap 本身并不是一个复杂的 SEO 技术。对于大多数网站来说,真正需要做好的事情其实只有几步:把希望进入搜索结果的重要规范 URL 放进去,保持lastmod尽量准确,确保 Sitemap 能够稳定返回正常状态,然后通过 Google Search Console 或 robots.txt 告诉搜索引擎它的位置。

如果 Sitemap 已经提交,但 Google 一直读取失败,或者页面迟迟没有被发现,也不要只盯着 XML 文件本身反复修改。继续检查 HTTP 状态、HTTPS、robots.txt、canonical、内部链接以及 CDN 和服务器访问状态,往往更容易找到真正影响抓取和索引的问题。Sitemap的价值不是让搜索引擎“必须收录”某个页面,而是尽可能减少搜索引擎发现重要内容时遇到的阻碍。把这一点做好,才是网站地图在实际 SEO 中真正发挥作用的地方。

相关问答

Q1:XML Sitemap 对 Google SEO 排名有直接帮助吗?

答: 明确地说,提交 Sitemap 不会直接提升你网页的关键词排名。它的本质是给 Googlebot(谷歌蜘蛛)发一张“路线图”,告诉它网站上有哪些页面、哪些是主页面、什么时候更新过。作用是提高抓取和收录的效率,特别是对新站、大站或结构深的页面。只有页面先被 Google 顺利发现并收录,才谈得上后面的排名。

Q2:网站页面很少,还需要专门做 XML 网站地图吗?

答: 如果你的网站只有几十个页面,而且导航菜单、内链做得很清晰,Googlebot 其实顺着链接就能把网站爬个遍,这种情况下 Sitemap 并不是硬性刚需。但强烈建议还是做一份。因为搭建并提交 Sitemap 成本极低,还能让你在 Google Search Console (GSC) 里直观看到地图的解析状态,属于百利而无一害的基础配置。

Q3:Sitemap 里的<lastmod>标签重要吗?要不要每天自动更新?

答: Google 现在会参考<lastmod>(最后修改时间),但前提是它必须是真实的。如果你只是改了页脚版权年份、或者什么都没动就每天自动刷新<lastmod>日期,Googlebot 很快就会发现这个时间不准,后续可能会直接忽略你提供的修改时间。只有当页面正文、数据或核心结构发生实质性更新时,再去更新这个标签。

Q4:网站页面太多,一个 Sitemap 装不下怎么办?

答: 按照 Google 和 Sitemap 协议的标准,单个 XML Sitemap 文件最多只能包含 50,000 个 URL,且解压后文件不能超过 50MB。 如果你的网站(比如大型电商或资讯站)超过了这个限制,正确的做法是拆分成多个子 Sitemap(例如product-sitemap-1.xml、product-sitemap-2.xml),然后用一个 Sitemap Index(站点地图索引文件) 把它们统一汇总起来,最后直接向 Google 提交那个 Index 文件即可。