多爬蟲分組
支援通配爬蟲、Googlebot、Bingbot、GPTBot 與自定義 User-agent。
設定爬蟲群組、路徑規則和 Sitemap 宣告。
robots.txt 內容
User-agent: *
搜尋引擎抓取控制
robots.txt 位於網站根目錄,用於告訴遵守 Robots Exclusion Protocol 的爬蟲哪些路徑可以或不應抓取。規則按 User-agent 分組,並可宣告 Sitemap 地址。
robots.txt 不是訪問控制,也不能可靠阻止頁面進入索引。敏感內容必須通過身份驗證保護;需要移除搜尋結果時,應結合 noindex、刪除狀態或搜尋平臺工具。
支援通配爬蟲、Googlebot、Bingbot、GPTBot 與自定義 User-agent。
按組維護允許和禁止路徑,識別無效格式與全站遮蔽。
新增一個或多個絕對 Sitemap URL,並自動去重。
一條過寬的 Disallow 可能阻斷整個網站、CSS/JS 或重要頁面抓取,而無效語法可能被爬蟲直接忽略。
為後臺、搜尋引數和低價值路徑設定明確的抓取邊界。
對全站遮蔽、無效路徑、重複分組和不受支援指令給出提示。
在同一檔案中宣告正式 Sitemap,幫助爬蟲發現 URL 清單。
所有輸入只在瀏覽器本地處理,不請求目標網站,也不儲存配置。
選擇常見 User-agent 或填寫實際爬蟲名稱。
分別新增 Allow 與 Disallow,按最長匹配規則組織。
新增完整 HTTPS Sitemap 地址並去重。
複製或下載檔案,釋出到域名根目錄 /robots.txt。
不一定。被其他頁面連結的 URL 仍可能以無摘要形式出現。需要阻止索引時,應允許抓取並返回 noindex,或移除頁面。
不能。robots.txt 是公開檔案,任何人都能看到規則;後臺必須使用登入、許可權和網路控制保護。
Googlebot 不支援 robots.txt 中的 Crawl-delay。抓取速率應通過伺服器效能、Google Search Console 或響應狀態管理。
主流爬蟲通常採用匹配長度更長的規則;相同長度時 Allow 常優先,但應避免依賴模糊衝突。
必須放在協議與主機對應的根目錄,例如 https://example.com/robots.txt。子目錄中的同名檔案不會控制整個站點。
釋出後檢查實際檔案響應、規則匹配和 Sitemap 可用性。