先给结论:当同一事实必须在多篇文章里出现时,不要试图把它改写得多几个同义词就算“不同”,而应指定一个“事实主页面”承载完整事实,其他文章只保留读者在该文语境下必需的最小事实,并链接回主页面。判断是否冗余的标准不是文字重合度,而是读者在同一阅读路径上是否被迫读第二遍同样的解释。
常见做法是发现两篇文章讲同一件事,就把后一篇里的重复段落删干净。结果有时会看到:被删的页面访问时长下降、从该页进入下一步操作的人变少。这容易被解释成“重复内容其实有用”,但更稳妥的读法是:删掉的不只是重复事实,还删掉了承接上下文的过渡信息,读者不知道当前这段和前后结论是什么关系。
所以真正要处理的不是“事实出现几次”,而是“这个事实在这里承担什么功能”。功能不同,保留程度就不同;功能相同,才是该压缩的对象。
解释一:事实确实被重复承载。同一组数据、同一段背景、同一个定义,在两篇文章里都以完整形态出现,读者无论从哪篇进入都要读一遍完整版。这种情况下,重复的是信息量。
解释二:事实只出现一次,但被反复指向。比如每篇文章都写一句“关于这一点前面已经说过”,或者用同义改写把同一结论说三遍。这种情况下,重复的是表述动作,而不是信息本身。
两种解释对应的动作完全不同。前者要拆分工,后者要压缩表达。若不加区分地统一“降重”,很可能把承担解释功能的句子删掉,却留下真正重复的整段背景。
可以核对三类可观察信号,而不是凭感觉判断:
这三类证据指向不同动作,不能只凭文字重合比例下结论。文字重合高但功能不同的段落,压缩后往往损失信息。
一个可执行的做法是给每类反复出现的事实指定唯一主页面,并注明它在其他页面中的角色。假设有三篇文章都要用到同一组对比事实,可以这样分工:
做完这一步后,观察被压缩页面的读者是否还能顺利走到下一步。如果链接点击集中在压缩后的那一句,说明主页面承接有效,可以继续压缩其他页面;如果读者在压缩处停滞,说明该事实在这个语境里承担了独立解释功能,应恢复必要细节而不是恢复整段。
这个动作的结果会直接影响下一步:链接被点击,说明分工成立;链接被忽略而页面离开率上升,说明该页面的读者路径不经过主页面,需要在本页保留更多上下文,或者调整链接出现的位置。
没有适用于所有页面的关键词密度、字数或标题字符阈值,也不存在“同义词换写就等于新内容”的规则。把“点击优化”理解成在重复事实里塞入更多近义表达,通常只会让读者读得更慢,而不会带来新的判断依据。
更可靠的做法是回到读者任务:同一事实如果帮助读者完成当前页面的决定,就保留;如果只是为了让本页看起来完整,就压缩为一句并指向主页面。压缩后要验证读者是否仍能完成下一步动作,而不是只看文字是否变短。把事实分工、链接承接和读者路径放在一起检查,才能判断这次减少冗余是否真的成立。