核对抓取限制,目的是确认搜索引擎能不能正常访问你要排名的页面。最直接的做法是:先用站点日志或搜索控制台里的抓取统计看真实请求,再用 robots.txt、页面 meta 指令和服务器响应逐项比对。如果页面被屏蔽、返回错误或长期不被抓取,内容再好也很难进入排名竞争。时间人手有限时,先查“整站级屏蔽”,再查“目录级屏蔽”,最后查“单页级限制”,因为影响面从大到小,修复代价也从低到高。
抓取限制不等于排名限制,核对时要分开看:
<meta name="robots" content="noindex"> 或 HTTP 响应头里,意思是“可以抓,但别进索引”。它和 robots.txt 的作用方向不同。如果 robots.txt 屏蔽了某个目录,爬虫根本看不到目录里的 noindex;反过来,只加了 noindex 但 robots.txt 允许抓取,页面仍可能被抓取后移除索引。核对顺序错了,结论就会错。
不要只看配置文件,要看真实请求。可执行的检查项:
日志分析的代价是需要服务器权限和一定时间;没有日志权限时,可以退而使用搜索控制台提供的抓取统计和网址检查工具,但要注意这些数据有延迟,不能当作实时结论。
假设你怀疑某个栏目页没被抓取,按下面顺序核对:
https://你的域名/robots.txt,检查是否有 Disallow: / 或针对该目录的屏蔽规则。注意规则是前缀匹配,Disallow: /news 会同时挡住 /news 和 /news-2024。noindex。如果存在,确认它是模板统一加的,还是单页误加。X-Robots-Tag: noindex。响应头优先级高,且容易被忽略。判断结果:robots.txt 屏蔽属于抓取层面,修复后需要等爬虫重新访问;noindex 属于索引层面,移除后也需要重新抓取才会生效。两者都不承诺固定见效时间,因为还受抓取预算、站点权重和搜索需求变化影响。
如果只能先做一件事,优先查整站级限制:
这样排序的原因是:整站屏蔽会让所有页面失去抓取机会,修复一处收益最大;单页限制影响范围小,可以稍后处理。代价是整站级检查需要服务器或搜索控制台权限,如果都没有,就只能从 robots.txt 和页面源代码入手,结论的完整度会下降。
比较改动前后数据时,要留意季节和搜索需求变化。比如同一批词在淡旺季的抓取和展示量本来就会波动,不能把波动全部归因于这次修复。更稳妥的做法是对比同类页面、同类时间段,而不是只看单个页面的绝对数字。
把 robots.txt 规则、重点目录、核心页面的 meta 指令和响应头各抽查一遍,记录检查日期和当时状态。下次排名波动时,先对照这份清单排除抓取限制,再讨论内容和外链,能省下大量重复排查时间。