先给结论:在排除内部流量之前,应先把待排除的访问做一份可回溯的名单或规则快照;排除之后再检查“被剔除的记录里是否含有真实用户”。检查的核心不是看总量掉了多少,而是抽查被剔除记录的特征,并与一个未受规则影响的时间窗或来源做对照。如果被剔除记录里出现登录后行为、真实转化路径或来自非内部网段的正常访问,就说明规则可能删掉了真实访问,需要收窄条件而不是直接接受新口径。
两种做法成立的前提不同,检查方式也不同。
如果你无法说明规则属于哪一类,说明排除动作还不可审计,此时不应继续做前后对比,而应先把规则写成可复查的条目。
排除内部流量之前,至少保留三样东西,否则事后无法判断是否误删。
动作示例:假设你准备按 IP 段排除办公网络。先导出该 IP 段近七天的访问明细,人工抽查其中是否包含登录账号、下单或提交表单的记录。如果抽查发现该段里有真实转化,说明这个段不是纯内部出口,直接整体排除就会误删。这一步的结果会决定下一步:要么把规则收窄到具体子段,要么改为按行为特征排除。
只看剩余数据的总量变化,无法区分“内部流量确实被清掉”和“真实访问被误删”。总量下降对这两种情况都成立,所以它不能单独作为判断依据。站内统计、搜索引擎报告和第三方估算的口径本来就不同,三者同时下降也可能只是统计方式变化,不能直接归因于排除动作。
更可靠的做法是双向核对:
具体动作:把排除前后的两份明细按来源标识做差集,得到“被剔除记录”。随机抽取其中若干条,逐条看它是否具备真实访问特征。如果抽到的记录全部是无登录、无转化、来源集中在同一网段,误删可能性较低;如果抽到登录或转化记录,就需要回退规则并重新界定范围。这个结果直接决定你是接受新口径,还是修正规则后再跑一次。
有些现象看起来像误删,实际另有解释,需要先排除:
反过来,有些误删不会立刻显现:被剔除的记录里可能只有少量真实访问,短期内总量看不出异常,但长期会表现为某些长尾路径的访问持续缺失。因此检查应针对被剔除集合做抽样,而不是只盯总量曲线。
如果被剔除集合中未发现登录、转化或非内部来源,且存活集合中内部访问已基本消失,可以接受当前口径,并把规则快照归档,作为后续对比的基线。
如果被剔除集合中出现真实访问特征,应回退到排除前的数据,收窄规则后重新执行。收窄的方向取决于证据:来源段过宽就细分网段;行为阈值过严就提高阈值或增加“有转化则保留”的例外。每次调整后重复上述双向核对,直到被剔除集合不再包含真实访问。这个循环的停止条件是有证据支撑的,而不是访问量降到某个数字。