上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能否抓到页面、抓到后是否允许索引、索引时看到的内容是否与预期一致。时间和人手有限时,先做能拦住整站问题的检查,再抽查重点页面,最后才处理细节优化。
抓取是搜索引擎发现并读取页面的过程,索引是读取后判断是否值得收录并存入结果的过程。两道关卡的配置不同,排查顺序也不同。
robots.txt、服务器可访问性、内链与站点地图是否指向真实页面。<meta name="robots">、HTTP 响应头中的 X-Robots-Tag、页面是否返回 200 状态码。判断顺序建议从抓取开始。抓取被阻断时,索引配置再正确也没有意义。
按“影响面 × 修复代价”排序,优先处理会一次性影响全站的配置,再抽查单页。
robots.txt,确认没有误写 Disallow: / 这类全站屏蔽规则,并确认其中引用的站点地图地址可访问。<meta name="robots">,确认没有 noindex;如果模板统一输出了该标签,要确认是有意为之。X-Robots-Tag: noindex,这类配置在页面源码里看不到,容易漏查。假设某案例中栏目页源码没有 noindex,但服务器对全部页面统一加了 X-Robots-Tag: noindex,那么仅检查源码会得出错误结论。这就是把响应头列为必查项的原因。
抽查重点页面时,不要只看“能不能打开”,要核对搜索引擎实际拿到的版本。
<link rel="canonical"> 指向自身或正确的首选地址,避免多个地址互相竞争。适用条件是页面数量可控、能逐项打开核对。页面规模很大时,改为抽查首页、栏目页、详情页各若干条,再借助日志或抓取记录判断整体情况。
同一页面出现多种信号时,需要比较条件而不是凭感觉决定。
noindex 与规范地址指向他页同时存在:两者都指向“不希望此页被收录”,应统一为一种明确意图。处理代价上,全站级配置改动影响面大,改完要重新抽查多个页面;单页配置改动快,但容易遗漏同类模板生成的页面。时间有限时,先改全站级,再批量核对同类页面。
把下面几项做成一次可执行的检查,完成后即可上线。
robots.txt 未屏蔽正式内容,站点地图地址可访问。noindex。下一步:把这份清单落到一次实际上线流程中,指定一人执行、一人复核,并在上线后固定时间点复查抓取与索引状态,避免配置在上线过程中被覆盖。