上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能访问到页面、页面愿意被抓取、抓取后能正确进入索引。多人协作时,建议把这三项做成一份上线检查表,由负责开发和负责内容的人分别确认,再统一复查,避免上线后才发现整站被挡或大量页面重复。
打开浏览器访问站点根目录下的 /robots.txt,检查是否存在 Disallow: / 这类整站禁止抓取的规则。测试环境常会加这条规则防止被收录,如果上线时忘记删除,搜索引擎就不会抓取任何页面。
判断方法:把 robots.txt 里的规则逐条对照当前目录结构,确认没有误伤需要收录的栏目。处理方式是由开发修改文件并重新发布,复查时再次访问该地址,确认禁止规则已移除。注意 robots.txt 只控制抓取,不控制索引,被禁止抓取的页面仍可能因外部链接出现在结果中。
查看页面源代码中的 <meta name="robots"> 标签。如果内容是 noindex 或 none,页面即使被抓取也不会进入索引。这类标签常见于模板默认设置、测试环境配置或复制自其他项目的代码。
核对范围要覆盖首页、栏目页、内容页和分页,不能只查首页。多人协作时容易出现模板层已去掉 noindex,但个别页面由编辑器手动添加的情况。处理办法是统一在模板层控制,禁止在单页随意写入 robots 标签,复查时抽查不同类型页面各一个。
canonical 用来告诉搜索引擎哪个地址是页面的规范版本。如果列表页、带参数的地址都指向同一个 canonical,可能造成部分页面不被索引;如果每个页面都错误地指向首页,则大量内容页会被判定为重复。
检查项包括:内容页的 canonical 是否指向自身完整地址;分页的第二页及以后是否指向自身而非第一页;带跟踪参数的地址是否归并到无参数版本。判断依据是页面实际对外提供的唯一地址。处理时由开发调整模板输出逻辑,复查时对比浏览器地址与源代码中的 canonical 是否一致。
站点地图应只包含需要收录的规范地址,不应包含被禁止抓取或标记 noindex 的页面。同时要确认这些地址能通过站内链接被访问到,孤立页面即使写进 sitemap,抓取优先级也较低。
适用条件是站点已有稳定栏目结构;如果栏目还在频繁调整,可先保证主要栏目进入 sitemap,后续再补充。复查时重新提交并观察抓取情况,但不保证固定时间内完成收录。
上线不是终点。发布后应再次访问 /robots.txt,抽查首页和内容页源代码,确认没有回退到测试配置。如果使用了内容管理系统,要确认发布流程不会覆盖已修改的模板文件。
多人协作时,建议在交付清单中写明:谁负责修改 robots.txt、谁负责确认 noindex、谁负责核对 canonical,并记录每项的检查时间和结果。下一步可以按上述四项做一次完整走查,把发现的问题直接落到具体文件和页面地址,再安排一次上线后的复查。