上线前核对抓取与索引配置,核心是确认两件事:搜索引擎能否顺利抓到页面,以及抓到的页面是否被允许进入索引。实操上可以分两条路线:一条是“先放开抓取、再逐项收紧”,适合页面量大、结构尚未完全稳定的站点;另一条是“先全面屏蔽、再按目录放开”,适合测试环境刚转生产、或需要分批放量的站点。两条路线的检查项相同,差别在于默认状态和出错代价。
默认放开意味着 robots.txt 不设全站禁止,页面返回正常状态码,抓取工具可以顺着链接进入。它的代价是:如果页面上线时还带着测试数据、重复参数或未完成的栏目,这些内容可能被先抓进去,之后要靠改版和重新抓取来修正,周期更长。
默认屏蔽意味着先在 robots.txt 中写全站禁止,或对整站加访问限制,再按目录逐个放开。它的代价是:放开动作必须有人执行,漏放一个目录,这个目录就可能长期不被发现;如果放开后没有主动提交,等待自然发现的时间也会拉长。
判断依据很简单:如果上线时页面结构、URL 规则、栏目归属已经定稿,选默认放开,把精力放在逐项核对上;如果仍会大改 URL 或大量删页,选默认屏蔽,按已定稿的目录分批放开。判断结果可以落成一句话:结构稳定选放开,结构会变选屏蔽。
抓取环节要看的不是“有没有写”,而是“写的内容和实际页面是否一致”。建议按下面顺序检查:
这里要区分“可能原因”和“已定位原因”。比如某页没被抓到,可能原因包括被 robots 禁止、没有内链、站点地图未包含、服务器对该抓取工具返回异常;只有在逐项排除后,才能说原因是哪一个。
抓取允许不等于索引允许。索引环节主要看两点:
<link rel="canonical"> 指向自己或真正的规范版本。列表页带排序、筛选参数时,规范地址不要指回首页,否则等于放弃该页的独立索引。一个可执行的短例子(假设):某站点有 500 个商品页,其中 80 个是颜色变体。若变体页各自独立收录,需要为每页写自指 canonical,并保证有独立内容;若不希望变体页收录,则把变体页 canonical 指向主商品页,并在站点地图中只保留主商品页。两种做法都成立,区别在于是否愿意为变体页维护独立内容。
把上面的检查项套进两条路线,可以这样决策:
选择时不要只看哪种更省事,要看哪种出错后更容易回退。放开路线的错误是“不该收录的被收录”,回退要等重新抓取;屏蔽路线的错误是“该收录的没被收录”,回退只需改一行规则并主动提交。结构越不稳定,越应该选回退成本低的那条。
无论选哪条路线,上线当天按这个顺序走一遍:先确认服务器对抓取工具返回正常状态码,再确认 robots.txt 没有误禁,然后确认站点地图可访问且 URL 返回 200,接着抽查 canonical 与 meta robots,最后在抓取工具中提交站点地图并观察抓取记录。每一步只解决一个问题,出现异常时先回退到上一步的配置,再继续往后查。
下一步建议:把上述检查项整理成一张上线核对表,按“抓取—索引—提交”三列填写实际结果,每次改版后复用同一张表,避免遗漏。