先给有条件的结论:当一批页面只有一部分被发现时,可以把“是否出现在收录入口相关信号里”当作分组依据,但前提是这些页面在同一目录、同一模板、同一发布批次内,且外链和站内链接条件接近。满足这些前提时,按入口信号有无分组,能帮你判断问题更可能出在入口暴露环节,还是页面本身不被接受。不满足时,这种分组会制造假对照。
批量页面里“一部分被发现”本身不是原因,它只是结果。要划分对照组,先列出可能同时影响发现概率的变量:链接来源(是否有站内入口、外链)、发布时间(新旧差异)、模板与内容类型(列表页、详情页、聚合页)、URL 结构(层级深浅、参数多少)、服务端返回状态(200、301、404、5xx)。如果两组在这些变量上差异过大,后面看到的差异就不能归给收录入口。
可操作的做法是:先从同一目录、同一模板、同一周发布的页面里,按“是否出现在站点地图且被站内链接指向”分成两组,每组各取 20–30 条。这个数量不是统计显著性的保证,只是让差异更容易被看见。分组后先核对两组的 HTTP 状态码和 robots 规则是否一致,不一致的页面直接移出对照,不要拿来比较。
假设一批 200 个详情页中,有 60 个被发现,140 个没有。若这 200 个页面同属一个目录、同一模板、同一批发布,且站内链接结构相同,那么可以按“是否出现在站点地图”或“是否被站内链接指向”做二分:
如果组 A 的发现比例明显高于组 B,说明入口暴露差异值得优先排查。下一步动作是:把组 B 中缺失的站内链接补上,或把页面加入站点地图,然后观察同一批页面的发现情况是否变化。这里的关键不是“加了就一定会被收录”,而是通过补入口后再看分组差异是否缩小,来决定继续查入口,还是转向内容质量与重复问题。
需要说明的是,站点地图不保证收录,robots.txt 的抓取限制也不等于可靠的索引移除。你看到的“未发现”可能来自抓取预算分配、页面质量判断或外部链接差异,而不是入口本身。分组只是缩小排查范围,不是证明因果。
假设你按“是否有站内链接”分组,发现无链接组发现率低,于是判断是入口问题。但实际情况可能是:无链接组恰好都是发布时间更晚、内容更短、或从同一批低质量来源生成的页面。这时入口和内容质量是绑在一起的,你无法区分是缺链接导致未发现,还是内容本身不被接受。
这类反例的识别方法是:在分组后,再检查两组在发布时间、内容长度、模板版本、外链数量上是否接近。如果某一项差异明显,就先把这一项拆出来单独对照。例如只取同一周发布、同一模板版本的页面重新分组。若重新分组后差异消失,原来的结论就不成立。
另一个反例是:页面虽然出现在站点地图里,但站点地图本身未被有效抓取,或者站点地图中的 URL 返回了非 200 状态。这种情况下,“出现在站点地图”并不等于入口有效。你需要先确认站点地图可访问、格式正确、其中的 URL 可正常返回,再把它当作分组依据。
完成分组和变量核对后,按以下顺序推进:
整个过程中,不要用单次抓取量或请求量归零来证明处理正确。抓取量下降可能有多种解释,包括服务器响应变慢、抓取预算重新分配、或页面被其他信号影响。只有当你控制了其他变量,并且分组差异在多次观察中保持一致,才能把结论往前推一步。
如果页面分属不同目录、不同模板、不同语言版本,或者发布时间跨度很大,这套按入口信号分组的方法就不适用。此时更合理的做法是先按目录或模板分层,再在每一层内部做对照。否则你看到的差异可能来自结构差异,而不是入口差异。
另外,如果站点本身规模很小,页面总数不足几十条,分组后每组只有几条,差异很容易被偶然因素放大。这时不建议强行分组,而是逐条检查入口、状态码和内容,再决定是否需要批量处理。
把分组当作缩小范围的工具,而不是结论本身。先锁变量,再分组,再补入口,再看变化,才能让下一步动作有依据。