先给结论:当筛选参数、排序参数、追踪参数可以自由组合时,不存在一个“天然正确”的有效地址全集,只能由你按业务价值划定一条收口线,把地址分成保留、改写、退出三类,并让站点地图、内链和抓取规则共用同一条线。样本阶段看起来没问题的做法,一旦参数维度交叉,往往会在规模化后失效。
样本量小时,几十个参数组合都能被抓到,容易让人误以为“只要提交就会收”。规模化后出现例外,通常有两种不同原因,需要用不同证据区分。
两者的处理方向不同:前者要收缩地址集合的定义,后者要调整优先级。如果只看到“抓取量下降”就断定是收录出了问题,容易误判,因为抓取量归零还可能来自服务器临时不可达、robots 规则变更或站点整体改版,这些都不能单独证明你的参数处理正确。
保留的前提是该组合能独立满足一类真实需求,并且有稳定入口指向它。可用的判断依据包括:
满足这些条件的组合应当进入站点地图,并获得规范链接指向自身。这里要注意,站点地图不保证收录,它只是把候选地址交给搜索引擎,是否处理仍取决于对方判断。保留集合一旦确定,就要同步检查内链是否真的指向这些地址,否则保留只停留在文件层面。
当多个参数组合指向近似内容时,改写比直接保留更合适。常见做法有两种,适用前提不同。
?a=1&b=2 与 ?b=2&a=1 归为同一地址。适用于参数本身无序、组合语义相同的场景。前提是重排逻辑不会误伤确实有顺序含义的参数。需要提醒的是,robots.txt 的抓取限制不等于可靠的索引移除。被禁止抓取的地址仍可能因外部链接出现在结果中,只是你无法通过抓取日志观察它。因此改写策略应以规范链接和可抓取性为主,而不是单纯依赖屏蔽。
退出的判断标准是:该组合既无独立需求,也无稳定入口,且持续消耗抓取资源。退出不等于删除内容,可以保留页面可访问但不再主动提交,并移除内链入口。
假设一个电商站有颜色、尺码、排序三个参数,理论组合数很大。若其中只有“颜色+尺码”有真实筛选需求,而“排序”参数只是同一结果的顺序变化,那么可以把排序类地址归入退出集合。这个例子只用于说明比较方法:先按需求维度分类,再决定去留,而不是按参数个数一刀切。
退出后需要观察的下一步动作是:核心目录的抓取占比是否回升。如果回升,说明此前存在预算挤压;如果没有变化,则说明问题不在参数地址,需要回到抓取预算的其他来源继续排查。
定义有效地址集合的最终产物不是一份静态清单,而是一组可复用的规则:保留集合进入站点地图并获得内链;改写集合统一规范目标并归一参数顺序;退出集合停止主动提交并清理入口。规则确定后,先在一两个目录上验证抓取分布的变化,再决定是否推广到全站。不同搜索引擎对参数和规范的处理方式存在差异,规则上线前应分别核查各自的支持情况,而不是假定一套逻辑通用。