把额度当预算来花,先挑“能改变你下一步动作”的样本,而不是覆盖面最广的样本。具体做法是:先写出一句待验证的判断,再从待处理对象里挑出对这句判断最敏感的少数条目去查;如果结果一致,就按这个判断批量处理,如果不一致,再缩小到分歧最大的那一档继续查。
条件一:你已经有一个明确假设,只是不确定它是否普遍成立。这时样本要挑“最可能推翻假设”的对象,比如最旧的内容、最冷门的栏目、最边缘的合作方。它们一旦也符合假设,说明假设的适用范围比预想更宽,可以放心批量推进。
条件二:你还没有假设,只是想判断一批旧内容、旧系统或旧合作关系里哪些还值得留。这时样本要挑“处在去留边界上”的对象,而不是最差或最好的。最差的删掉没有争议,最好的保留也没有争议,真正消耗判断力的是中间那批,查它们的信息回报最高。
两种条件的共同点是:样本服务于一个即将做出的决定。如果一次查询不能对应任何后续动作,这次查询的信息量就是零,无论它看起来多完整。
反过来,有三种情况不值得花额度:只是想让报告数字更整齐;对象即将整体下线,个体差异不再影响决策;以及结果无论怎样你都会做同一件事。
假设你有一批三年前发布的旧页面需要决定是否退出,额度只够查其中一小部分。先按“是否仍有外部引用”这个假设分组,从每组里各挑两到三个处在边界上的页面去查。若边界样本大多仍有引用,就先保留这一组、只处理明显无引用的部分;若边界样本大多已无引用,就可以把整组列入退出清单,再把额度转向下一组。这里的关键不是样本数量,而是每组样本能否把“保留整组”和“退出整组”区分开。
第一步,把待处理对象按一个可观察的属性分组,例如内容类型、最后修改时间、合作是否仍在续期。第二步,在每组内按“最可能推翻当前判断”的标准挑少量对象。第三步,查完后立刻记录:结果支持还是推翻了原判断,以及因此改变了哪个动作。
这个记录动作会直接影响下一步。如果某一组的结果反复推翻判断,说明分组维度选错了,应该换一个维度重新分,而不是在同一组里继续加样本。如果某一组的结果高度一致,就可以停止取样,把额度移到还没验证的组。
当对象数量很少、或者一次错误决定会带来难以回退的后果时,逐项确认比抽样更稳妥。另一种例外是对象之间差异极大且无法预先分组,这时抽样的代表性很差,少量样本反而会误导判断。遇到这两种情况,宁可缩小处理范围,也不要勉强用样本结论去覆盖全部对象。
另外,查询结果为空或某项统计归零,不能单独证明对象已经没有价值。它可能只是该来源暂时不可用、查询方式不匹配,或数据本身尚未更新。把这类结果当作“需要换一种方式复核”的信号,而不是直接当作退出依据。