上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引结果指向正确的URL。最容易被忽略的是第三步——很多站点只检查了robots.txt和meta标签,却没验证最终返回给爬虫的HTML里是否真的带着正确配置。下面按准备、实施、验证、维护四步说明具体做法。
在动任何配置之前,先列出一份URL清单,明确每个地址的预期状态。这份清单是后续所有核对工作的判断依据,没有它就只能凭感觉检查。
清单可以用表格维护,至少包含三列:完整URL、预期状态(可索引/禁止索引/跳转)、跳转目标。对衢州网站开发项目而言,如果站点做过改版或更换域名,这份清单还要覆盖历史URL,否则旧链接会以404或重复内容的形式留在索引里。
抓取与索引由多个层级共同决定,任何一层设置错误都可能让前面的努力失效。需要同时检查以下三处:
Disallow: /误封整站,也没有把需要收录的目录写进禁止列表。注意robots.txt只控制抓取,不控制索引——被禁止抓取的URL仍可能因为外部链接而出现在索引中。<meta name="robots" content="noindex">。这类标签常因模板复用被带到正式页面,是上线后不收录的高频原因。X-Robots-Tag: noindex。这个设置优先级高且不显示在页面源码里,只看HTML会漏掉。另外确认服务器对不存在页面返回404而非200,对跳转返回301而非302(临时跳转不利于权重传递)。如果站点使用JavaScript渲染内容,还要确认关键文本和链接在初始HTML或可被抓取的渲染结果中存在,而不是只在用户交互后才出现。
配置写完不等于生效。验证阶段要模拟爬虫发起请求,看实际返回的内容,而不是只看后台设置项。
curl -I 你的URL查看状态码和响应头,确认没有意外的noindex或跳转。curl -A "Googlebot" 你的URL抓取正文,搜索noindex、canonical等关键字,确认渲染后的HTML符合预期。判断标准很直接:如果抓取测试显示“已抓取,未索引”,优先排查内容质量和重复问题;如果显示“已发现,未抓取”,优先排查robots.txt和内链深度;如果显示“被noindex排除”,回到上一步检查meta标签和响应头。不同搜索引擎的提示措辞不同,但排查方向一致。
上线当天的配置正确,不代表一周后仍然正确。模板更新、插件升级、运营人员误操作都可能重新引入noindex或错误的robots规则。
建议固定一个检查节奏:每次发布新模板或调整路由规则后,重新跑一遍上面的curl验证;每月查看一次站点管理工具中的覆盖率报告,重点关注“已排除”类别的数量变化。如果排除数量突然上升,先对比最近的发布记录,定位是哪次改动引入了问题。
下一步可以做的具体动作:把本文的URL清单整理成表格,对每个地址执行一次curl -I并记录状态码与响应头,把结果与预期状态逐行比对,标记出不一致的条目优先处理。