robots.txt 檢測

robots.txt 檢測

檢查網站抓取規則、禁止路徑和網站地圖宣告。

範例: 工具會自動請求網站根目錄的 /robots.txt,結果僅顯示在目前頁面。預設測試 Googlebot 是否允許抓取此路徑。

robots.txt 檢測結果

尚未開始檢測

輸入網站網址並選擇要測試的路徑,然後點擊「開始檢測」。

ROBOTS.TXT SEO

什麼是 robots.txt 檢測?

robots.txt 是網站根目錄中的純文字檔案,用來向搜尋引擎爬蟲表達哪些路徑可以抓取、哪些路徑應避開。它是抓取提示,不是存取權限控制。

本工具會請求目標站點的 /robots.txt,解析 User-agent、Allow、Disallow、Crawl-delay 和 Sitemap,並用 Googlebot 判定指定路徑是否會被規則禁止。

User-agent

指定套用規則的爬蟲分組。

Allow / Disallow

控制遵守規則的爬蟲可以抓取哪些路徑。

Sitemap

指向 XML 網站地圖,協助爬蟲發現網址。

為什麼站長需要檢查 robots.txt?

規則寫錯、路徑過度禁止或 sitemap 地址失效,都可能讓搜尋引擎無法發現和抓取重要頁面。改版、搬站和更換 CMS 後,應重新核對 robots.txt。

避免誤封重要頁面

確認首頁、產品頁和文章路徑沒有被 Disallow 規則意外擋住。

發現規則衝突

比較 Allow 與 Disallow 的最長匹配結果,定位實際被禁止的路徑。

核對網站地圖入口

檢查 robots.txt 中宣告的 Sitemap 是否為有效的完整網址。

工具是如何工作的?

檢測只讀取公開的 robots.txt,不會修改網站檔案,也不會寫入歷史資料庫。

  1. 01

    規範化網站網址

    提取網域和協定,固定請求根目錄的 /robots.txt。

  2. 02

    安全讀取檔案

    解析目標 IP,拒絕內網位址,限制重定向、逾時和回應大小。

  3. 03

    解析抓取規則

    按 User-agent 分組識別 Allow、Disallow、Crawl-delay 與 Sitemap。

  4. 04

    判定測試路徑

    使用 Googlebot 套用最長匹配規則,顯示診斷與修改建議。

如何理解檢測結果?

檔案狀態、規則解析和路徑判定代表不同層面。404 代表未找到 robots.txt,不等於網站無法存取;請求異常也不能直接說明規則錯誤。

已找到

檔案成功回應,並已完成解析。

未找到

找不到根目錄檔案;這不代表網站無法存取。

請求異常

逾時或伺服器錯誤需要重試,不能直接判斷規則。

robots.txt 檢測常見問題

robots.txt 應該放在哪裡?

它必須位於網站主機的根目錄,例如 https://example.com/robots.txt。放在 /blog/robots.txt 等子目錄不會成為整個主機的標準抓取規則。

Disallow: / 會讓網站從搜尋結果消失嗎?

它會阻止遵守規則的爬蟲抓取頁面,但搜尋引擎仍可能透過外部連結知道 URL。索引控制還需要頁面級 noindex 等訊號。

Allow 和 Disallow 同時匹配時如何處理?

主流爬蟲通常使用匹配路徑較長的規則;長度相同時 Allow 優先。本工具按此常見規則對 Googlebot 判定。

robots.txt 可以取代登入或防火牆嗎?

不可以。robots.txt 是公開的抓取提示,不能保護敏感資料。需要存取控制時應使用驗證、權限策略或防火牆。

為什麼 Sitemap 不一定要寫在 robots.txt?

網站地圖也可以透過 Search Console 等站長平台提交。寫在 robots.txt 有助於爬蟲自動發現,但地址必須是完整絕對網址。