上线前核对抓取与索引配置,核心是分别检查 robots.txt、页面级 robots 标签、站点可见性设置和 XML 站点地图这四项,确认它们没有互相矛盾。抓取控制决定搜索引擎能否访问页面,索引控制决定已抓取的页面能否进入结果,两者必须分开判断,不能只看其中一项。
在正式上线前,可以通过以下迹象判断配置是否需要复查:
noindex,但页面本身希望被收录;这些现象只是线索,不能单独作为结论。比如页面未被收录,可能是抓取被拦截,也可能是页面质量或重复内容问题,需要逐项排查后才能定位。
抓取控制常用的手段是 robots.txt 中的 Disallow 规则,它告诉爬虫不要访问某些路径。索引控制常用的手段是页面 <meta name="robots" content="noindex"> 或 HTTP 响应头中的 X-Robots-Tag,它告诉搜索引擎不要把页面放入索引。
关键区别在于:
WordPress 后台的“搜索引擎可见性”选项,在多数版本中会直接影响 robots.txt 输出或页面级指令。上线前应确认它处于允许索引的状态,除非站点确实处于开发阶段。不同主题和插件可能对这一设置有额外处理,因此不能只凭后台勾选状态下结论,必须查看实际输出的 robots.txt 和页面源代码。具体行为以你当前安装的版本和插件实际输出为准。
建议按以下顺序操作,每一步都记录修改前后的状态,便于复查:
你的域名/robots.txt,检查是否存在 Disallow: /。如果存在且不是有意屏蔽全站,删除或改为只屏蔽必要路径。noindex。如果有,检查是主题、SEO 插件还是自定义代码加入的,并确认是否应该移除。X-Robots-Tag: noindex。如果站点使用了缓存插件或 CDN,修改后需要清除缓存再复查,否则看到的可能仍是旧配置。
上线前常见的两种处理方式,适用条件不同:
如果站点仍处于开发或迁移阶段,可以暂时禁止抓取和索引,但上线时必须切换回方案一或按页面分别处理,否则上线后可能长时间不被收录。
修改完成后,不要只依赖后台显示的状态。应重新访问 robots.txt 确认内容已更新,重新抓取一个页面确认 noindex 已移除,并在搜索控制台或站长平台中提交站点地图、使用 URL 检查工具查看实际抓取结果。如果平台显示的状态与预期不符,优先检查缓存、CDN 和服务器端响应头,而不是反复修改 WordPress 设置。复查通过后,再逐步提交主要页面并观察抓取统计,确认没有异常拦截。