上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常抓取页面、页面愿意被抓取、抓到的页面值得进索引。时间和人手有限时,按“先封堵错误、再验证通路、最后抽查样本”的顺序做,通常一个下午可以完成第一轮。
这类问题一旦存在,后面所有内容优化都没有意义,所以必须最先处理。
/robots.txt,确认返回 200,而不是 404 或 403。如果返回 404,搜索引擎会视为“没有限制”,通常不会阻断抓取,但说明你少了一道可控开关。Disallow: / 这样的整站封禁。如果测试站阶段加过,上线时忘了删,就是最典型的自伤。X-Robots-Tag。有些服务器或 CDN 配置会统一加上 noindex,这种限制不写在 HTML 里,只看网页源码发现不了。<meta name="robots">,确认没有 noindex 或 nofollow 残留。模板批量生成时,这类标签很容易被带到所有页面。判断结果很简单:只要上述任何一处对整站生效,就先修配置,不要急着提交任何东西。
首页能打开,不代表栏目页和详情页能被抓到。企业站常见的结构是首页、产品/服务列表页、详情页、关于我们、联系方式,抽查时每一类都要覆盖。
验收信号是:抽查的每一类页面都能直接打开、返回正常状态码、正文在源码中可见、且能从首页沿链接走到。
“能抓取”和“愿意收录”是两件事。上线前要确认重要页面没有被主动排除,同时避免同一内容出现多个地址。
noindex;如果某类页面确实不想被收录,比如后台或搜索结果页,应明确加上限制,而不是靠 robots.txt 阻止抓取——被阻止抓取的页面,搜索引擎也无法读取其中的 noindex。www 和不带 www、http 和 https、带与不带结尾斜杠,最好只保留一个版本,其余做 301 跳转。<link rel="canonical"> 是否指向页面自身或正确的首选地址,避免全站都指向首页。适用条件是:你已经有明确的首选域名和 URL 规则。如果规则还没定,先定规则再改标签,否则会反复返工。
配置改完不等于生效,需要留出观察窗口。可以执行的下一步是:上线后尽快在搜索平台的站点管理工具中提交 sitemap,并用抓取测试功能逐个检查首页、一个列表页、一个详情页,确认返回的是“可抓取、可索引”。随后几天观察已收录页面数是否从零开始增长,以及抓取统计里是否出现大量 5xx 或 404。
如果发现某类页面持续不被抓取,先回到 robots.txt、响应头和 meta 标签三处复查,再检查是否有服务器频繁超时。不要在没有定位原因前批量修改模板,那会把已经正常的页面一起改坏。