入口页面能被百度正常收录,并不代表深层链路健康。当旧栏目、旧产品线或旧合作关系准备退出时,常见的情况是首页或列表页仍在索引里,但点进去的二级、三级页面已经不收录或抓取失败。定位断点的关键不是重新提交入口,而是沿链接逐层验证:哪一层开始出现状态码异常、哪一层开始被 robots 拦截、哪一层开始只剩空壳内容。先找出第一处断点,再决定是修复、保留还是彻底下线。
深层页面不收录,通常有两种方向完全不同的原因。第一种是技术链路断点:中间层返回 404、301 指向失效地址、被 robots.txt 拦截,或服务端对深层路径直接拒绝。第二种是内容价值断点:页面能打开、状态码正常,但正文被模板、登录墙或脚本掏空,百度抓到的是重复框架,于是不再保留。两者的处理方式相反——前者要修链路,后者要决定是否让这批页面退出。
能区分它们的证据是:用抓取工具或 curl -I 请求深层 URL,看返回的状态码和最终地址;再对比页面源码里是否存在与入口页明显不同的正文。如果状态码正常但正文与入口页高度雷同,问题更可能在内容侧;如果状态码异常或跳转到无关地址,问题在链路侧。
不要只看入口页。从入口页开始,手动或脚本抓取它链接出去的第一层、第二层 URL,记录每一跳的状态码和最终 URL。重点看三件事:
假设一个旧产品栏目准备退出,入口列表页仍返回 200,但每个产品详情页都 301 到栏目首页。这时断点不在入口,而在详情层被整体重定向。下一步就不是修详情页,而是判断这些详情是否还有保留价值:若无,应让它们返回 410 或保留可访问的归档说明,而不是全部堆到首页,避免入口页承担不属于它的内容。
如果深层 URL 返回 200、正文也正常,却始终不出现,需要核查 robots.txt 是否限制了该路径。要明确一点:robots.txt 的抓取限制不等于可靠的索引移除,它只约束抓取行为,已收录页面可能仍留在结果中;反过来,解除限制也不保证马上被抓取。站点地图同样只是发现线索,不保证收录。把深层 URL 放进站点地图、并确认 robots 未拦截,是必要动作,但不是收录承诺。
操作上,先确认深层路径没有被 robots 的 Disallow 覆盖,再看站点地图里是否包含这些 URL 且返回 200。如果两者都正常却仍无收录,应回到内容侧判断,而不是反复提交。
定位到断点后,决策取决于这批深层页面是否仍有价值。三种处理方式对应不同动作和结果:
需要提醒的是,抓取量或某路径的请求量归零,不能单独证明移除处理正确。它也可能来自抓取预算转移、站点地图未更新、或入口链接被其他改动连带清理。要结合状态码和上层链接是否仍指向该路径来判断。
把动作排成固定顺序,能减少反复:从入口页出发,逐层记录状态码和最终 URL;标记第一处异常层;检查该层是否被 robots 覆盖;确认站点地图是否仍指向失效地址;最后按保留、归档或移除决定处理方式。每完成一步,下一步的范围都会缩小——这正是定位断点比重新提交入口更有效的原因。若涉及 HTTPS,也要知道它不保证安全无漏洞或排名,链路排查仍以状态码和内容为准。