处理 Yahoo 收录中的重复或冲突信号,核心不是急着删页面,而是先确认同一组内容被哪些 URL 暴露、哪些信号在互相矛盾,再决定保留哪一个版本、让其余版本如何退出索引。常见冲突包括 www 与非 www 同时可访问、带参数 URL 与规范 URL 都能打开、页面 meta robots 与 robots.txt 给出相反指令、站点地图提交的地址与页面内 canonical 指向不一致。起点是先做一次可复查的 URL 盘点,而不是直接改模板。
从搜索表现和抓取记录入手,比凭感觉判断可靠。可以按下面顺序收集证据:
site: 查询观察同一内容出现几个 URL 版本,记录标题、摘要和地址差异。<link rel="canonical">、<meta name="robots">,与 HTTP 响应头和 robots.txt 对照。这一步只记录现象,不下结论。同一现象可能有多个解释,例如某个参数 URL 被抓取,可能是站内链接带参数,也可能是外部链接指向该地址,还可能是站点地图误提交,需要继续分辨。
真重复通常指两个以上 URL 返回相同或高度相似的主体内容,且都能被正常访问。信号冲突则指内容只有一个合理版本,但页面内指令、HTTP 头、robots.txt、站点地图或站内链接给出了不一致的指向。
判断时可用一张对照表:
这里要区分一个常见误解:robots.txt 的抓取限制不等于可靠的索引移除。它阻止的是抓取,不是索引本身;如果页面已被收录,单靠 robots.txt 通常不能让记录消失。站点地图也不保证收录,它只是提交候选地址,是否抓取和索引由搜索引擎自行决定。HTTPS 同样不保证安全无漏洞或排名,它只是传输层条件之一。
确认主版本后,处理动作要落在正确的层级:
假设一个站点同时存在 https://example.com/page 和 https://www.example.com/page,两者都返回 200,站内链接混用,站点地图只提交了其中一个。此时应选定一个主机名,另一个做 301,并把 canonical、内链和站点地图统一到主版本。这是假设示例,不是真实项目结果。适用条件是两版内容确实相同;如果两版内容有实质差异,应先决定是否合并内容,而不是机械跳转。
修改不会立即反映,复查要留出抓取和重新评估的时间。可以按以下检查项逐条核对:
site: 查询观察重复地址是否减少,但不要把收录数量变化当成唯一成功标准。不同搜索引擎对 canonical、robots.txt 和站点地图的支持与处理方式需要分别核查,Yahoo 相关的抓取与索引表现应以实际抓取记录和搜索结果为准。如果复查后旧地址仍长期存在,优先检查是否仍有外部链接或站内链接持续指向它,而不是反复修改同一处指令。
下一步:选一组当前最明显的重复或冲突 URL,按上面的观察清单记录状态码、canonical、robots 指令和站点地图提交地址,先确认冲突类型,再决定改跳转、改 canonical 还是改站点地图。