结论先说:额度有限时,不要按“看起来重要”挑样本,而要按“能证伪一个假设”挑样本。最省额度的做法,是先用少量样本验证一个最可能出错的环节,而不是把额度平摊到多个方向。这个结论成立的前提是你已经有一个明确待验证的假设;如果你连假设都没有,先别动额度,先写下来。
同样一批样本,用来验证不同假设,信息量差别很大。常见的有三类:
额度有限时,优先验证边界假设。原因是覆盖和一致性往往需要较大样本才能看出比例,而边界假设只要找到一两个反例就能推进决策。例如你怀疑“只有含特定结构的对象才会被正确处理”,那么挑一个含该结构的对象和一个不含的对照,两个样本就能给出方向。
最有信息量的一组样本,是彼此在某一个维度上不同、其余维度尽量接近。这样结果差异才能归因到那个维度上。反过来,如果样本在长度、结构、来源上都不同,即使结果不一样,你也说不清是哪个因素造成的。
一个假设的例子:你想知道某类对象的处理是否受长度影响。与其挑十个长度各异的对象,不如挑三组,每组两个,组内长度接近,组间长度拉开,其余条件保持一致。这样即使只有六个样本,也能看出长度是否是一个可区分的因素。这里的关键动作是先固定其他变量,只留一个变量在动;做完这一步,你才知道下一轮该扩大哪个方向,而不是盲目加样本。
以下样本在额度紧张时性价比通常偏低:
排除的标准不是“不重要”,而是“测完不能改变你的下一步”。如果一个样本无论结果如何,你都不会调整做法,那它就不该占用额度。
如果待验证的问题本身是比例问题,比如“有多大范围受影响”,那么按假设挑少量样本反而会误导你。此时一两个反例只能说明“存在这种情况”,不能说明“这种情况有多普遍”。在这种场景下,少量样本的信息量天然不足,你需要的是随机抽样而不是定向抽样。换句话说,前面的结论只在“验证规则是否成立”时成立,一旦问题变成“影响面有多大”,就必须换方法,否则你会拿个别结果当成整体结论。
先把你的疑问写成一句可证伪的话,再列出能区分它的两到三个样本,只测这几个,然后根据结果决定是扩大样本还是换假设。如果结果出现了你无法解释的差异,先回到“样本之间到底差在哪”这一步,而不是立刻加测更多对象。额度真正浪费的情形,往往不是测得少,而是测完不知道该改什么。