自动评分只能覆盖可量化、可重复的指标,而需要人工判断的项目——例如旧系统是否值得保留、旧合作关系是否延续——一旦被塞进同一个百分制,就会被自动评分悄悄替代。防止这种情况的关键,不是关掉评分,而是把人工判断项从评分输入中拆出来,单独记录判断依据和结论,再与自动分数并列展示,而不是合并成一个总分。
矛盾现象很常见:一份测速报告里,某项指标得分很低,团队据此决定关停一个旧系统;但关停后才发现,这个系统承担着一个无法快速迁移的少数场景,实际损失远超分数反映的问题。
有两种解释都成立。第一种是评分口径本身没问题,只是人工判断项被错误地量化成了分数,比如把“是否仍有业务依赖”折算成 0—10 分。第二种是评分口径不适用于这个对象,自动评分测的是加载速度、响应时间这类可重复指标,而“是否退出”属于价值判断,两者本就不该放在同一张表里比较。
能区分这两种解释的证据,是看评分项的输入是否来自可重复的测量。如果某一项的分数来自人工填写的估计值,那它本质上仍是人工判断,只是被包装成了数字;如果某一项来自工具直接采集的指标,那它才真正适合自动评分。把这两类输入混在一列里,是替代发生的地方。
具体动作是:在测速工具的评分之外,单独建一份退出评估清单,每一项只写“保留理由”或“退出理由”,不折算分数。例如,假设某旧系统在测速工具里响应时间指标得分很低,但清单中记录“仍有一个内部流程依赖它,迁移需要额外两周”,那么结论可以是“暂缓退出,先迁移依赖”,而不是直接按分数关停。
这个动作的结果会直接影响下一步:如果清单显示保留理由有明确负责人和时间点,就可以进入迁移排期;如果保留理由只是“用惯了”,那它不构成保留依据,可以按自动评分建议退出。区分标准是理由能否被验证,而不是理由听起来是否合理。
如果对象数量很大,可以先按自动评分筛掉明显不合格的部分,再对剩下的做人工判断;如果对象数量很少,直接人工判断即可,不必先跑一遍评分。选择哪种方式,取决于判断项能否被可重复测量,而不是取决于工具是否提供了评分功能。
人工判断容易被替代,往往不是因为分数更准,而是因为分数更好记录。要防止这一点,复查记录里至少保留三样东西:判断项的名称、当时的依据、以及做出结论的日期。这样下次复查时,可以看到依据是否仍然成立,而不是只看到一个分数变化。
假设某旧合作关系在测速工具相关评估中得分下降,复查记录显示下降原因是对方接口响应变慢,但合作本身仍有不可替代的资源。那么下一步可以是“保留合作,同时要求对方改善接口”,而不是直接终止。这个结论无法从分数本身推出,只能从记录的依据中推出。
需要核对的适用条件是:具体工具是否支持自定义指标、是否允许导出原始测量值、评分口径是否公开。这些信息因工具而异,需要以工具当前实际提供的说明为准。如果工具只给出一个总分,没有原始测量值,那它更适合做初筛,不适合作为退出决策的唯一依据。
这个顺序的核心是让自动评分回到它擅长的位置:处理可重复、可比较的测量结果。而需要人工判断的项目,继续由人根据可验证的依据来决定,而不是被一个看起来客观的分数替代。只要依据和日期被记录下来,下一次复查时就能看出判断是否仍然成立,也就不会在不知不觉中把决定权交给评分。