robots.txt
Disallow 會限制抓取路徑,但它與 noindex 的作用不同,不能單獨保證網址從索引中消失。
TECHNICAL SEO
頁面可索引性檢測從搜尋引擎抓取視角判斷一個網頁能否被存取、允許抓取並具備進入索引庫的基礎條件。它會把 HTTP 回應、robots.txt、頁面級 robots 指令和 Canonical 放在同一份報告中。
可抓取不等於一定收錄。搜尋引擎還會評估內容品質、重複程度、網站權威性和內部連結;本工具專門定位技術層面的收錄阻斷。
Disallow 會限制抓取路徑,但它與 noindex 的作用不同,不能單獨保證網址從索引中消失。
noindex 可透過 HTML Meta 或 X-Robots-Tag 回應標頭宣告,兩處都必須檢查。
Canonical 用於宣告首選網址;無效、重複或意外跨頁指向可能讓目前頁面不作為規範結果展示。
一次範本發布、環境變數錯誤或 SEO 外掛變更,就可能把 noindex 帶到正式環境,或讓 Canonical 指向錯誤網址。越早發現這些訊號,越能減少頁面長期不收錄、索引被替換和抓取預算浪費。
識別 4xx/5xx、robots.txt 禁止和 noindex。
檢查 Canonical 是否唯一、有效並符合預期。
查看最終網址和完整重新導向鏈。
伺服器安全取得目標頁面一次,並額外請求網站根目錄 robots.txt;所有頁面級訊號都從同一份 HTML 中解析。
拒絕本機、內網和保留位址,限制跳轉、逾時和回應大小。
記錄每次 3xx 跳轉,並確認最終狀態和最終網址。
讀取 Meta Robots、X-Robots-Tag、Canonical 和 hreflang。
檢查 robots.txt 是否允許目前路徑,並給出分級修改建議。
搜尋引擎會綜合多個訊號決定是否抓取、是否建立索引以及把哪個網址作為規範頁面。檢測結果需要結合頁面用途判斷。
最終頁面通常應穩定返回 200;過長鏈路、循環跳轉和 4xx/5xx 會妨礙抓取。
Disallow 會限制抓取路徑,但它與 noindex 的作用不同,不能單獨保證網址從索引中消失。
noindex 可透過 HTML Meta 或 X-Robots-Tag 回應標頭宣告,兩處都必須檢查。
Canonical 用於宣告首選網址;無效、重複或意外跨頁指向可能讓目前頁面不作為規範結果展示。
不會。通過表示沒有發現明顯技術阻斷,實際收錄還取決於內容品質、重複頁面、內部連結、網站信譽和搜尋引擎排程。
允許抓取只是前提。還要檢查 noindex、Canonical、HTTP 狀態、內容品質以及頁面是否能被站內連結發現。
不一定。搜尋引擎可能仍根據外部連結保留網址。需要刪除索引時,應讓搜尋引擎可以抓取頁面並讀取 noindex,或按平台流程申請移除。
不會。結果只保留在目前頁面狀態,不寫入資料庫,也不產生公開歷史頁面。