先给结论:入口页正常不能证明整条链路健康,最可能的第一断点在内链层级、抓取预算分配或渲染后内容缺失,而不是入口页本身。定位时应把“从入口到深层页”拆成可独立验证的跳转、抓取、渲染、索引四段,用单变量动作逐段确认,而不是一次性改多处。
假设一个站点结构为 /guide/ → /guide/topic-a/ → /guide/topic-a/detail-1/。入口页 /guide/ 在 Google 中可见,第二层部分页面可见,第三层大量页面长期不出现。这个现象不能直接归因于“第三层内容质量差”,因为入口正常只说明抓取工具能到达入口,不代表它能沿链接继续走完三层。
此时要做的第一个动作是:从入口页出发,用纯文本链接图(<a href>)检查到第三层的最短路径是否存在。若第三层只能通过 JavaScript 事件、表单提交或需要登录后才生成的链接到达,抓取工具很可能在第二层就停下。这个检查结果决定下一步:若路径不存在,先补可抓取的静态链接;若路径存在,再进入抓取与渲染排查。
确认从入口到深层页的每条链接都是可解析的 <a href>,而不是依赖点击事件或 onclick。若深层链接只出现在分页组件、筛选器或“加载更多”按钮中,抓取工具通常不会主动触发这些交互。此时一个实际动作是把关键深层链接写入服务端输出的 HTML 导航或站点地图,并观察后续抓取日志中该路径是否出现。若日志中仍无该路径,说明问题在抓取调度而非链接发现。
检查 robots.txt 是否只限制了部分目录。需要明确:robots.txt 的抓取限制不等于可靠的索引移除,它只阻止抓取,不保证已索引页面被移除;反过来,解除限制也不保证立即恢复收录。若 robots.txt 中误写了深层目录,抓取工具会直接跳过,入口页正常也无法改变这一点。
若深层页的主要内容由 JavaScript 在客户端生成,抓取工具可能拿到的是空壳 HTML。此时应对比“原始 HTML 中是否包含正文”与“渲染后是否包含正文”。一个可操作动作是:对同一深层 URL 分别查看原始响应和渲染后 DOM,若原始响应缺少正文,且该站点的渲染队列出现延迟,则不能把收录失败简单归因于内容质量。
即使抓取和渲染都正常,页面仍可能因重复、规范化或质量判断而未进入索引。此时要区分“已抓取未索引”和“未抓取”。若抓取日志显示已抓取但未索引,问题更可能在内容相似度或站点整体质量;若从未抓取,问题更可能在链接发现或抓取预算。两种情况的修复动作不同,不能混用。
个别样本成立不代表可以规模化复制。假设你只检查了三个深层页,发现补了内链后其中一个被收录,就推断“补内链能解决全部深层收录”,这是把单点观察当成普遍规律。规模化后可能出现例外:部分深层页由不同模板生成、部分依赖不同渲染方式、部分被分页参数拆散。此时应按模板、目录层级、渲染方式分层抽样,而不是对所有深层页执行同一动作。
边界条件也要写清:若站点使用站点地图提交深层链接,站点地图不保证收录,它只帮助发现;若站点启用了 HTTPS,HTTPS 不保证安全无漏洞或排名,它只是传输层条件。不同搜索引擎对 JavaScript 渲染和站点地图的支持情况不同,须分别核查,不能把 Google 的观察直接套用到其他引擎。
robots.txt、抓取预算和目录深度,排除人为限制。每一步的结果都会改变下一步:路径缺失时不应先改内容,抓取受限时不应先改模板,渲染缺失时不应先提交移除请求。只有把断点定位到具体一段,修复动作才有可验证的反馈。