上线前核对抓取与索引配置,核心是确认三件事:目标页面能被抓取、能被索引、且只暴露你希望被索引的版本。最稳妥的做法是:先在预发布环境用小范围测试验证规则,再在上线后复查线上实际返回内容。不要只依赖后台开关或插件提示,必须看服务器真实响应。
抓取是索引的前提。上线前打开浏览器访问 /robots.txt,确认没有误封整站。常见误配是测试阶段写了 Disallow: /,上线后忘记删除。判断方法:如果整站被禁止抓取,搜索引擎无法获取页面内容,后续索引无从谈起。
这里要区分“可能原因”和“已定位原因”。页面未收录可能是因为抓取被禁,也可能是内容质量或重复问题,不能一见未收录就断定是 robots.txt 的错。
索引控制主要靠页面内的 <meta name="robots"> 和 <link rel="canonical">。前者决定是否允许索引,后者告诉搜索引擎哪个 URL 是规范版本。
假设一个产品页同时能通过带参数和不带参数两种 URL 访问,如果两版都返回 200 且没有 canonical 指向,就可能被视为重复内容。此时应选择一个主版本,并在另一版加上指向它的 canonical。适用条件是两版内容高度相同;如果内容确实不同,就不该强行合并。
核对时逐项确认:
noindex。方案一:用 robots.txt 禁止抓取某类页面。适合纯后台、临时目录等不需要出现在搜索结果中的路径。缺点是搜索引擎无法看到页面上的 canonical 等信号,且被禁止抓取的 URL 仍可能因外链被索引。
方案二:允许抓取但用 noindex 阻止索引。适合希望搜索引擎读取页面、但不展示在结果中的内容,比如部分聚合页。缺点是会消耗抓取配额。
判断依据:如果页面完全不需要被搜索引擎理解,选方案一;如果需要传递规范化信号或后续可能开放索引,选方案二。两者不要对同一批 URL 同时使用,否则容易产生冲突。
上线不是终点。发布后应再次访问关键页面,确认响应头、meta 标签和 canonical 与预发布环境一致。可以借助搜索引擎官方提供的抓取测试或 URL 检查类工具,查看实际抓取到的 HTML。注意不同搜索引擎、网页搜索与付费广告是分开的系统,广告可投不代表自然搜索会收录。
复查清单:核心页面返回 200;robots.txt 未误封;无意外 noindex;canonical 指向正确;站点地图中的 URL 均可访问。发现不一致时,先定位是模板、服务器配置还是缓存导致,再修改并重新验证,而不是反复提交收录请求。
下一步:挑出你站点最重要的三到五个页面,按上面的抓取层和索引层逐项核对,把每一项的实际结果记录下来,再决定是否需要调整规则。