先给结论:如果手上只有咨询记录,没有可用的用户标识,你无法把“多次咨询”还原成“多少个人”。能做的只是把“次数”和“可辨认的人数”分开报告,并明确后者是下限。具体做法是:先给每条记录找一个稳定标识,再判断这个标识能否跨天、跨设备、跨渠道复用;能复用就按人去重,不能复用就只统计次数,同时把不确定部分单独标注。
打开你手上的咨询表或后台导出文件,逐列确认能拿到哪些字段。常见情况只有三种:
判断标准很简单:这个字段在两次咨询之间会不会变。手机号一般不变,设备号会变,昵称会变,会话 ID 每次都变。会变的字段不能用来判断是不是同一个人。
假设你有一张咨询记录表,字段包括时间、渠道、手机号(部分为空)。可以这样处理:
这样做的结果是,你不再对外给一个含糊的“咨询人数”,而是给出一个可追溯的下限。下一步无论是做内容排期还是判断某篇文章是否带来持续咨询,都基于这个下限,而不是基于被去重放大的数字。
反过来也要小心:标识相同不等于人相同。一个手机号可能被同事共用,一个邮箱可能是公司公共邮箱,一个微信号可能由多人轮流使用。所以按标识去重得到的是“可辨认的咨询主体数”,不是严格的自然人数。
如果你要判断的是“某篇博客是否带来了重复咨询”,可以换一个角度:看同一标识的咨询是否集中在同一话题、同一时间段。如果同一手机号在两天内问了同一类问题,更可能是同一个人分次追问;如果间隔数月且话题完全不同,把它当成同一个人反而会误导后续判断。这里的证据是时间间隔和话题一致性,而不是标识本身。
如果你没有后台导出权限,只能看到前台咨询列表,仍然可以做一件事:在每条记录旁手工标注当天日期、渠道和一个自定的稳定标识(例如对方留下的联系方式末四位加渠道)。这个动作不改变原始数据,只是让你在后续统计时能区分“同一天同一渠道的重复”和“跨天跨渠道的重复”。
做完标注后,你能得到的结论仅限于:在你能看到的范围内,有多少条记录可以归并。你不能由此推出全站咨询人数,也不能推出某篇文章带来了多少独立访客。第三方估算流量、搜索引擎报告和站内统计的口径本来就不同,任何单一数字都不足以还原完整的用户行为。
如果咨询量很小,比如一周只有个位数,区分人数和次数的收益很低,直接按次数记录并注明“未去重”更省事。如果咨询量很大但标识缺失严重,去重后剩下的可识别比例太低,这个人数下限也不具备决策价值,此时按次数看趋势反而更稳。
判断依据是:可识别记录占总记录的比例,以及你打算用这个数字做什么决定。比例过低时,任何基于人数的比较都可能被缺失字段带偏;比例较高时,人数下限才值得写进报告并用于下一步的内容调整。