当筛选参数、排序字段、分页游标和追踪参数可以自由组合时,URL 空间会迅速膨胀到无法逐一枚举。有效地址集合不该由“所有能生成的 URL”定义,而应由“值得被索引、且能被稳定复现的地址”定义。做法是先给参数分组,再为每组设定可保留、可改写、必须退出三类规则,最后用抓取与索引数据验证规则,而不是指望 robots.txt 或站点地图替你完成清理。
无限组合的根源通常不是参数数量,而是参数之间可以互相叠加。把参数按功能分成三层,判断会清晰很多。
分层的实际动作是:先拉取一段时间的访问日志或抓取记录,按参数名统计出现频率与组合深度。如果某个参数几乎只和另外两三个参数同时出现,它多半属于视图修饰层或追踪层,而不是独立的内容维度。这个判断会直接决定下一步是保留、改写还是退出。
一个地址要进入有效集合,至少同时满足三点,缺一项就应归入待处理或退出。
假设一个站点有地区、品类、排序、分页四类参数。地区与品类组合可能产生数百个有检索价值的地址,而排序与分页再乘上去会放大到数十万。此时合理的做法是:保留地区与品类的组合,把排序固定为默认值,分页只保留前若干页可索引,其余通过规范化或抓取限制处理。这里的数字只是说明比较方法,不是任何真实站点的统计。
需要退出的地址,处理方式要分清目的:是不希望被抓取,还是不希望被索引,还是希望彻底不可访问。
robots.txt 限制抓取,只能减少抓取,不能保证已收录地址从索引中消失。若页面已被索引,限制抓取反而可能让搜索引擎无法读到移除指令。这里有一个常见反常现象:某些参数地址的抓取量突然归零。它可能是清理生效,也可能是抓取预算被转移到别处、服务器响应变慢、或规则误伤了有效地址。抓取量归零本身不能证明处理正确,需要同时看有效地址的抓取是否稳定、索引量是否只减少了目标部分。
当退出原因是旧合作关系结束或旧系统下线,参数地址往往还带着外部链接和内部跳转。处理顺序建议如下。
如果旧系统无法返回自定义状态码,只能返回正常页面,那么退出会更慢,此时优先做站内链接清理和内容合并,而不是只依赖抓取限制。HTTPS 与安全、排名之间没有必然的保证关系,它不解决参数地址膨胀的问题,也不应作为退出决策的依据。
定义有效地址集合的最终产物,不是一份 URL 清单,而是一张判定表:参数名、所属层级、保留或改写或退出、对应处理动作、复核指标。每次新增参数时,先按这张表归类,再决定是否放行。这样即使组合继续增长,集合边界仍然可控。判定表需要定期用抓取和索引数据回看,因为搜索引擎对索引控制指令的支持情况并不一致,必要时应分别核查,而不是假设一套规则在所有环境下等效。