同站安全抓取
限制域名、深度、頁數、超時和響應體積,拒絕內網地址。
受限抓取同站頁面,篩選可索引網址並產生 sitemap.xml。
輸入網站網址後開始產生
站點發現與索引
XML Sitemap 是面向搜尋引擎的 URL 清單,用於幫助爬蟲發現站點中重要、規範且允許索引的頁面。它尤其適合新站、深層頁面、大型內容站和內部連結不足的頁面。
Sitemap 不能強制收錄,也不能替代內部連結、Canonical、robots 和頁面質量。高質量 Sitemap 應只包含返回成功、可索引並屬於當前站點的規範 URL。
限制域名、深度、頁數、超時和響應體積,拒絕內網地址。
排除錯誤狀態、noindex、非規範頁面和 robots 禁止路徑。
輸出 UTF-8 urlset,可複製或下載 sitemap.xml。
把重定向、404、noindex 或重複 URL 放進 Sitemap 會浪費抓取資源,並向搜尋引擎傳送矛盾訊號。
集中宣告站內可索引 URL,幫助爬蟲更快發現新頁面和深層頁面。
過濾明顯不應提交的狀態碼、noindex、非規範和受限地址。
限制抓取範圍並展示跳過原因,站長可以在提交前複核清單。
工具從一個公開入口開始,只遍歷同源 HTML 連結;結果短時快取,不建立資料庫歷史。
規範化網址,解析公網 IP,並拒絕本機、內網和保留地址。
按設定的頁數與深度併發抓取,只加入同源 HTTP/HTTPS 頁面。
檢查狀態碼、內容型別、noindex、Canonical 和 robots 規則。
去重並轉義 URL,輸出可複製或下載的 sitemap.xml。
不能。Sitemap 只幫助發現 URL,是否收錄仍取決於可抓取性、規範訊號、內容質量和搜尋引擎判斷。
主流搜尋引擎通常忽略這兩個欄位;虛構頻率和優先順序沒有收益,保持 URL 清單準確更重要。
lastmod 必須反映頁面真實的重大更新時間。工具不會用抓取時間冒充內容更新時間。
超過 50,000 個 URL 或 50MB 時應拆分多個 Sitemap,並使用 Sitemap Index 管理。大型站點更適合從 CMS 或資料庫生成。
不會寫入業務資料庫。伺服器僅使用短時快取降低重複抓取壓力,生成結果保留在當前頁面。
生成後繼續驗證 XML、抓取規則、索引狀態與頁面規範訊號。