頁面可索引性檢測

範例: 目標頁面只抓取一次,並額外檢查一次 robots.txt;結果不寫入資料庫。

頁面可索引性檢測結果

尚未開始檢測

輸入網頁網址,檢查搜尋引擎能否抓取並收錄該頁面。

TECHNICAL SEO

什麼是頁面可索引性檢測?

頁面可索引性檢測從搜尋引擎抓取視角判斷一個網頁能否被存取、允許抓取並具備進入索引庫的基礎條件。它會把 HTTP 回應、robots.txt、頁面級 robots 指令和 Canonical 放在同一份報告中。

可抓取不等於一定收錄。搜尋引擎還會評估內容品質、重複程度、網站權威性和內部連結;本工具專門定位技術層面的收錄阻斷。

robots.txt

Disallow 會限制抓取路徑,但它與 noindex 的作用不同,不能單獨保證網址從索引中消失。

Meta Robots

noindex 可透過 HTML Meta 或 X-Robots-Tag 回應標頭宣告,兩處都必須檢查。

Canonical

Canonical 用於宣告首選網址;無效、重複或意外跨頁指向可能讓目前頁面不作為規範結果展示。

為什麼要檢查網頁是否可索引?

一次範本發布、環境變數錯誤或 SEO 外掛變更,就可能把 noindex 帶到正式環境,或讓 Canonical 指向錯誤網址。越早發現這些訊號,越能減少頁面長期不收錄、索引被替換和抓取預算浪費。

發現硬性阻斷

識別 4xx/5xx、robots.txt 禁止和 noindex。

核對規範頁面

檢查 Canonical 是否唯一、有效並符合預期。

減少無效跳轉

查看最終網址和完整重新導向鏈。

工具是如何運作的?

伺服器安全取得目標頁面一次,並額外請求網站根目錄 robots.txt;所有頁面級訊號都從同一份 HTML 中解析。

  1. 01

    驗證公開網址

    拒絕本機、內網和保留位址,限制跳轉、逾時和回應大小。

  2. 02

    跟隨重新導向

    記錄每次 3xx 跳轉,並確認最終狀態和最終網址。

  3. 03

    解析索引指令

    讀取 Meta Robots、X-Robots-Tag、Canonical 和 hreflang。

  4. 04

    核對抓取規則

    檢查 robots.txt 是否允許目前路徑,並給出分級修改建議。

哪些訊號會影響頁面收錄?

搜尋引擎會綜合多個訊號決定是否抓取、是否建立索引以及把哪個網址作為規範頁面。檢測結果需要結合頁面用途判斷。

01

HTTP 狀態與重新導向

最終頁面通常應穩定返回 200;過長鏈路、循環跳轉和 4xx/5xx 會妨礙抓取。

02

robots.txt

Disallow 會限制抓取路徑,但它與 noindex 的作用不同,不能單獨保證網址從索引中消失。

03

Meta Robots 與回應標頭

noindex 可透過 HTML Meta 或 X-Robots-Tag 回應標頭宣告,兩處都必須檢查。

04

Canonical

Canonical 用於宣告首選網址;無效、重複或意外跨頁指向可能讓目前頁面不作為規範結果展示。

頁面可索引性檢測常見問題

檢測通過就一定會被搜尋引擎收錄嗎?+

不會。通過表示沒有發現明顯技術阻斷,實際收錄還取決於內容品質、重複頁面、內部連結、網站信譽和搜尋引擎排程。

robots.txt 允許抓取,為什麼頁面仍未收錄?+

允許抓取只是前提。還要檢查 noindex、Canonical、HTTP 狀態、內容品質以及頁面是否能被站內連結發現。

robots.txt 禁止後,頁面會從索引中刪除嗎?+

不一定。搜尋引擎可能仍根據外部連結保留網址。需要刪除索引時,應讓搜尋引擎可以抓取頁面並讀取 noindex,或按平台流程申請移除。

檢測結果會儲存嗎?+

不會。結果只保留在目前頁面狀態,不寫入資料庫,也不產生公開歷史頁面。