上线前核对抓取与索引配置,核心是确认三件事:爬虫能顺利抓到你希望被抓的页面,不该抓的页面确实被拦住,搜索引擎拿到的是最终要展示的版本。做法不复杂,但必须在正式对外发布前完成,因为上线后再改,已经抓取和收录的结果需要额外时间才会更新。下面按适用前提、具体检查项和验收信号说明。
抓取配置不是让所有页面都被抓。上线前应先列出三类清单:必须收录的页面、不需要收录但可以抓取的页面、必须完全屏蔽的页面。常见归属如下:
判断依据是页面是否对搜索用户有独立价值。如果两个地址展示几乎相同的内容,只保留一个可收录版本即可,其余用规范标签或抓取规则处理。这一步没想清楚,后面配置容易自相矛盾。
robots.txt 控制爬虫能否访问,meta robots 控制页面能否被索引。两者作用不同,冲突时结果常常出乎意料。检查时逐项确认:
你的域名/robots.txt,确认没有误写 Disallow: / 把整站挡住。<meta name="robots" content="noindex">。适用条件是你能直接编辑服务器上的 robots.txt 和页面模板。如果站点由第三方系统托管,先确认是否开放这两处配置,再决定用哪种方式。
同一内容存在多个可访问地址,是上线后索引分散的主要原因。逐项核对:
验收信号:在浏览器分别输入几个地址变体,观察是否都落到同一个最终地址;查看页面源代码中的规范标签,确认它和地址栏最终地址一致。如果规范标签指向一个打不开的地址,等于没有生效。
配置写完不等于生效,需要实际验证。可以按下面步骤操作:
假设某详情页在模板中默认输出了 noindex,运营以为上线后会自动收录,实际抓取测试会直接显示 noindex,这就是在发布前拦住问题的价值。这里的状态码和标签是可直接观察的,不需要猜测。
发布后不要立刻下结论。可观察的信号包括:抓取测试工具能正常返回内容,站点地图提交后被读取,搜索结果中逐步出现你期望的最终地址而不是地址变体。如果几天后仍只出现旧地址或参数地址,优先回头检查跳转和规范标签,而不是反复改关键词。
下一步建议:把上面几项整理成一份上线检查清单,每次发布新栏目或改版时逐项打勾。第一次接触这个问题,先完成 robots.txt、meta robots、地址统一和抓取测试这四项,就能覆盖大部分抓取与索引配置问题。