XML Sitemap 產生器

XML Sitemap 產生器

受限抓取同站頁面,篩選可索引網址並產生 sitemap.xml。

輸入網站網址後開始產生

站點發現與索引

什麼是 XML Sitemap?

XML Sitemap 是面向搜尋引擎的 URL 清單,用於幫助爬蟲發現站點中重要、規範且允許索引的頁面。它尤其適合新站、深層頁面、大型內容站和內部連結不足的頁面。

Sitemap 不能強制收錄,也不能替代內部連結、Canonical、robots 和頁面質量。高質量 Sitemap 應只包含返回成功、可索引並屬於當前站點的規範 URL。

生成範圍

CRAWL

同站安全抓取

限制域名、深度、頁數、超時和響應體積,拒絕內網地址。

INDEX

索引訊號過濾

排除錯誤狀態、noindex、非規範頁面和 robots 禁止路徑。

XML

規範 XML 輸出

輸出 UTF-8 urlset,可複製或下載 sitemap.xml。

為什麼要產生乾淨的 Sitemap?

把重定向、404、noindex 或重複 URL 放進 Sitemap 會浪費抓取資源,並向搜尋引擎傳送矛盾訊號。

加快重要頁面發現

集中宣告站內可索引 URL,幫助爬蟲更快發現新頁面和深層頁面。

減少索引衝突

過濾明顯不應提交的狀態碼、noindex、非規範和受限地址。

保持釋出可控

限制抓取範圍並展示跳過原因,站長可以在提交前複核清單。

Sitemap 產生器如何運作?

工具從一個公開入口開始,只遍歷同源 HTML 連結;結果短時快取,不建立資料庫歷史。

  1. 01

    校驗入口

    規範化網址,解析公網 IP,並拒絕本機、內網和保留地址。

  2. 02

    受限同站遍歷

    按設定的頁數與深度併發抓取,只加入同源 HTTP/HTTPS 頁面。

  3. 03

    篩選索引訊號

    檢查狀態碼、內容型別、noindex、Canonical 和 robots 規則。

  4. 04

    生成 XML

    去重並轉義 URL,輸出可複製或下載的 sitemap.xml。

XML Sitemap 產生常見問題

Sitemap 能保證頁面被收錄嗎?

不能。Sitemap 只幫助發現 URL,是否收錄仍取決於可抓取性、規範訊號、內容質量和搜尋引擎判斷。

為什麼工具不自動新增 changefreq 和 priority?

主流搜尋引擎通常忽略這兩個欄位;虛構頻率和優先順序沒有收益,保持 URL 清單準確更重要。

為什麼沒有給所有 URL 新增 lastmod?

lastmod 必須反映頁面真實的重大更新時間。工具不會用抓取時間冒充內容更新時間。

大型網站應該如何生成 Sitemap?

超過 50,000 個 URL 或 50MB 時應拆分多個 Sitemap,並使用 Sitemap Index 管理。大型站點更適合從 CMS 或資料庫生成。

生成結果會儲存嗎?

不會寫入業務資料庫。伺服器僅使用短時快取降低重複抓取壓力,生成結果保留在當前頁面。