页面可索引性检测

示例: 目标页面只抓取一次,并额外检查一次 robots.txt;结果不写入数据库。

页面可索引性检测结果

尚未开始检测

输入网页地址,检查搜索引擎能否抓取并收录该页面。

TECHNICAL SEO

什么是页面可索引性检测?

页面可索引性检测从搜索引擎抓取视角判断一个网页能否被访问、允许抓取并具备进入索引库的基础条件。它会把 HTTP 响应、robots.txt、页面级 robots 指令和 Canonical 放在同一份报告中。

可抓取不等于一定收录。搜索引擎还会评估内容质量、重复程度、站点权威性和内部链接;本工具专门定位技术层面的收录阻断。

robots.txt

Disallow 会限制抓取路径,但它与 noindex 的作用不同,不能单独保证 URL 从索引中消失。

Meta Robots

noindex 可通过 HTML Meta 或 X-Robots-Tag 响应头声明,两处都必须检查。

Canonical

Canonical 用于声明首选 URL;无效、重复或意外跨页指向可能让当前页不作为规范结果展示。

为什么要检查网页是否可索引?

一次模板发布、环境变量错误或 SEO 插件变更,就可能把 noindex 带到正式环境,或让 Canonical 指向错误地址。越早发现这些信号,越能减少页面长期不收录、索引被替换和抓取预算浪费。

发现硬性阻断

识别 4xx/5xx、robots.txt 禁止和 noindex。

核对规范页面

检查 Canonical 是否唯一、有效并符合预期。

减少无效跳转

查看最终 URL 和完整重定向链。

工具是如何工作的?

服务器安全获取目标页面一次,并额外请求站点根目录 robots.txt;所有页面级信号都从同一份 HTML 中解析。

  1. 01

    验证公开地址

    拒绝本机、内网和保留地址,限制跳转、超时和响应大小。

  2. 02

    跟随重定向

    记录每次 3xx 跳转,并确认最终状态和最终 URL。

  3. 03

    解析索引指令

    读取 Meta Robots、X-Robots-Tag、Canonical 和 hreflang。

  4. 04

    核对抓取规则

    检查 robots.txt 是否允许当前路径,并给出分级修改建议。

哪些信号会影响页面收录?

搜索引擎会综合多个信号决定是否抓取、是否建立索引以及把哪个 URL 作为规范页面。检测结果需要结合页面用途判断。

01

HTTP 状态与重定向

最终页面通常应稳定返回 200;过长链路、循环跳转和 4xx/5xx 会妨碍抓取。

02

robots.txt

Disallow 会限制抓取路径,但它与 noindex 的作用不同,不能单独保证 URL 从索引中消失。

03

Meta Robots 与响应头

noindex 可通过 HTML Meta 或 X-Robots-Tag 响应头声明,两处都必须检查。

04

Canonical

Canonical 用于声明首选 URL;无效、重复或意外跨页指向可能让当前页不作为规范结果展示。

页面可索引性检测常见问题

检测通过就一定会被搜索引擎收录吗?+

不会。通过表示没有发现明显技术阻断,实际收录还取决于内容质量、重复页面、内部链接、站点信誉和搜索引擎调度。

robots.txt 允许抓取,为什么页面仍未收录?+

允许抓取只是前提。还要检查 noindex、Canonical、HTTP 状态、内容质量以及页面是否能被站内链接发现。

robots.txt 禁止后,页面会从索引中删除吗?+

不一定。搜索引擎可能仍根据外部链接保留 URL。需要删除索引时,应让搜索引擎可以抓取页面并读取 noindex,或按平台流程申请移除。

检测结果会保存吗?+

不会。结果只保留在当前页面状态,不写入数据库,也不生成公开历史页面。