排查重复页面,核心不是先删谁,而是先判断重复的性质:是同一内容被多个URL访问,还是不同内容因模板、参数或分页产生了大量相似页面。前者优先做规范化或301,后者优先做参数治理和内容差异化。选择哪种方案,取决于重复页是否有独立搜索需求、是否有外部链接、以及维护成本。
在动手处理前,先用站内工具或搜索指令确认重复范围。常见来源有三类:
www与不带www、http与https、结尾带斜杠与不带斜杠访问。把重复URL导出成表,记录每个URL的收录状态、外链数、是否有独立流量。这一步决定后面选哪种方案。
如果两个URL展示的是同一篇内容,且其中一个有明显优势,比如外链更多、历史更久、已有稳定点击,就把另一个URL301永久重定向到保留页。若无法做301,可用rel="canonical"指向保留页。
适用条件:内容逐字相同或几乎相同;重复页没有独立搜索需求;重复页没有需要保留的外部链接。
代价:301会损失被重定向页面的部分历史信号,且如果重定向链过长,抓取效率会下降。canonical是建议信号,不保证一定被采纳。
如果筛选页、分页或标签页本身能解决用户的不同需求,比如“红色连衣裙”和“蓝色连衣裙”各有搜索量,就不应简单删除或全部重定向,而应:
robots.txt屏蔽无价值参数组合,但注意屏蔽后页面仍可能被外部链接引用。适用条件:重复页有独立搜索需求;有外部链接或用户收藏;内容差异可以低成本补充。
代价:维护成本高,需要持续监控参数组合和内容质量。若差异只是替换几个词,仍可能被判定为重复。
按顺序问自己:
假设一个服装站有200个颜色筛选页,其中只有5个颜色有搜索量。对这5个补充独立内容,其余195个用robots.txt屏蔽或301到主分类页。这是假设例子,不是真实项目结果。
处理重复页面后,不要只看收录数变化。季节、搜索需求波动、数据采集延迟都会影响判断。比较时固定同一时间段、同一数据源,并记录改动日期。若收录数下降但目标页点击上升,说明处理方向可能正确;若两者都下降,需检查是否误屏蔽了有价值页面。
下一步:从你导出的重复URL表中,先挑出外链最多和点击最多的各10个URL,按上面的三个检查项逐一标注处理方案,再批量执行其余低价值页面。