User-agent
指定套用規則的爬蟲分組。
ROBOTS.TXT SEO
robots.txt 是網站根目錄中的純文字檔案,用來向搜尋引擎爬蟲表達哪些路徑可以抓取、哪些路徑應避開。它是抓取提示,不是存取權限控制。
本工具會請求目標站點的 /robots.txt,解析 User-agent、Allow、Disallow、Crawl-delay 和 Sitemap,並用 Googlebot 判定指定路徑是否會被規則禁止。
指定套用規則的爬蟲分組。
控制遵守規則的爬蟲可以抓取哪些路徑。
指向 XML 網站地圖,協助爬蟲發現網址。
規則寫錯、路徑過度禁止或 sitemap 地址失效,都可能讓搜尋引擎無法發現和抓取重要頁面。改版、搬站和更換 CMS 後,應重新核對 robots.txt。
確認首頁、產品頁和文章路徑沒有被 Disallow 規則意外擋住。
比較 Allow 與 Disallow 的最長匹配結果,定位實際被禁止的路徑。
檢查 robots.txt 中宣告的 Sitemap 是否為有效的完整網址。
檢測只讀取公開的 robots.txt,不會修改網站檔案,也不會寫入歷史資料庫。
提取網域和協定,固定請求根目錄的 /robots.txt。
解析目標 IP,拒絕內網位址,限制重定向、逾時和回應大小。
按 User-agent 分組識別 Allow、Disallow、Crawl-delay 與 Sitemap。
使用 Googlebot 套用最長匹配規則,顯示診斷與修改建議。
檔案狀態、規則解析和路徑判定代表不同層面。404 代表未找到 robots.txt,不等於網站無法存取;請求異常也不能直接說明規則錯誤。
檔案成功回應,並已完成解析。
找不到根目錄檔案;這不代表網站無法存取。
逾時或伺服器錯誤需要重試,不能直接判斷規則。
它必須位於網站主機的根目錄,例如 https://example.com/robots.txt。放在 /blog/robots.txt 等子目錄不會成為整個主機的標準抓取規則。
它會阻止遵守規則的爬蟲抓取頁面,但搜尋引擎仍可能透過外部連結知道 URL。索引控制還需要頁面級 noindex 等訊號。
主流爬蟲通常使用匹配路徑較長的規則;長度相同時 Allow 優先。本工具按此常見規則對 Googlebot 判定。
不可以。robots.txt 是公開的抓取提示,不能保護敏感資料。需要存取控制時應使用驗證、權限策略或防火牆。
網站地圖也可以透過 Search Console 等站長平台提交。寫在 robots.txt 有助於爬蟲自動發現,但地址必須是完整絕對網址。
繼續檢查頁面回應、網站地圖和網站基礎 SEO 訊號。