robots.txt
Disallow 会限制抓取路径,但它与 noindex 的作用不同,不能单独保证 URL 从索引中消失。
TECHNICAL SEO
页面可索引性检测从搜索引擎抓取视角判断一个网页能否被访问、允许抓取并具备进入索引库的基础条件。它会把 HTTP 响应、robots.txt、页面级 robots 指令和 Canonical 放在同一份报告中。
可抓取不等于一定收录。搜索引擎还会评估内容质量、重复程度、站点权威性和内部链接;本工具专门定位技术层面的收录阻断。
Disallow 会限制抓取路径,但它与 noindex 的作用不同,不能单独保证 URL 从索引中消失。
noindex 可通过 HTML Meta 或 X-Robots-Tag 响应头声明,两处都必须检查。
Canonical 用于声明首选 URL;无效、重复或意外跨页指向可能让当前页不作为规范结果展示。
一次模板发布、环境变量错误或 SEO 插件变更,就可能把 noindex 带到正式环境,或让 Canonical 指向错误地址。越早发现这些信号,越能减少页面长期不收录、索引被替换和抓取预算浪费。
识别 4xx/5xx、robots.txt 禁止和 noindex。
检查 Canonical 是否唯一、有效并符合预期。
查看最终 URL 和完整重定向链。
服务器安全获取目标页面一次,并额外请求站点根目录 robots.txt;所有页面级信号都从同一份 HTML 中解析。
拒绝本机、内网和保留地址,限制跳转、超时和响应大小。
记录每次 3xx 跳转,并确认最终状态和最终 URL。
读取 Meta Robots、X-Robots-Tag、Canonical 和 hreflang。
检查 robots.txt 是否允许当前路径,并给出分级修改建议。
搜索引擎会综合多个信号决定是否抓取、是否建立索引以及把哪个 URL 作为规范页面。检测结果需要结合页面用途判断。
最终页面通常应稳定返回 200;过长链路、循环跳转和 4xx/5xx 会妨碍抓取。
Disallow 会限制抓取路径,但它与 noindex 的作用不同,不能单独保证 URL 从索引中消失。
noindex 可通过 HTML Meta 或 X-Robots-Tag 响应头声明,两处都必须检查。
Canonical 用于声明首选 URL;无效、重复或意外跨页指向可能让当前页不作为规范结果展示。
不会。通过表示没有发现明显技术阻断,实际收录还取决于内容质量、重复页面、内部链接、站点信誉和搜索引擎调度。
允许抓取只是前提。还要检查 noindex、Canonical、HTTP 状态、内容质量以及页面是否能被站内链接发现。
不一定。搜索引擎可能仍根据外部链接保留 URL。需要删除索引时,应让搜索引擎可以抓取页面并读取 noindex,或按平台流程申请移除。
不会。结果只保留在当前页面状态,不写入数据库,也不生成公开历史页面。