上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的版本是你想展示的版本、抓到的页面允许被收录。时间和人手有限时,建议先处理 robots.txt、可抓取性、canonical、sitemap 和 noindex 这五项,它们最容易造成整站不收录或收录错页面。
假设你为一家山东本地企业开发了新官网,测试环境用 test.example.com,正式域名是 www.example.com。上线三天后,在搜索引擎里搜品牌名找不到新站。排查时发现两个问题:一是测试阶段为了防止被收录,全站加过 noindex,迁移时没删;二是 robots.txt 里还留着 Disallow: /。这两个配置都会让页面无法进入索引,而且从外部看不出异常。
这个例子的处理顺序是:先看 robots.txt 是否放行,再看页面源码里有没有 noindex,然后确认正式域名返回的是 200 状态码而不是跳转到测试域名,最后检查 sitemap 里提交的是不是正式网址。每一步都能独立判断,不需要等搜索引擎给出反馈。
robots.txt 控制的是“能不能抓”,页面里的 noindex 控制的是“抓到了能不能索引”。两者作用不同,不能互相替代。常见错误是只改了其中一个,就以为问题解决了。
https://你的域名/robots.txt,确认没有针对全站的 Disallow: /。<head> 区域,确认没有 <meta name="robots" content="noindex">。X-Robots-Tag 响应头,同样要检查是否带 noindex。判断结果很直接:robots.txt 放行且页面没有 noindex,页面才具备被抓取并索引的前提。缺任何一项,收录都可能长期为零。
同一个页面可能通过多个地址访问,比如带 www 和不带 www、http 和 https、带结尾斜杠和不带。canonical 标签的作用是告诉搜索引擎哪个是首选版本。上线前要确认:
如果 canonical 指向了错误地址,可能出现两种情况:该收录的页面没收录,或者收录了不想展示的版本。核对时可以直接查看页面源码中的 <link rel="canonical">,逐个抽查栏目页和详情页。
sitemap 是给搜索引擎的网址清单,但它不能替代可抓取性。如果 sitemap 里的网址被 robots.txt 屏蔽,或者返回 404、301 到其他地址,提交了也没有意义。
可执行的检查步骤:
适用条件是网站已经有稳定的 URL 结构。如果上线前还在频繁改路径,先固定路径再生成 sitemap,否则提交的清单很快会失效。
如果只有半天时间,建议按影响面从大到小安排:
判断标准是:每一项都能通过直接访问网址或查看源码得到明确结果,不依赖搜索引擎后台数据。这样即使没有收录数据,也能在上线前发现大部分配置问题。
下一步可以做一个简单记录表,把上述五项检查结果逐条标注为通过或不通过,不通过的立即修复并重新核对一次。