核对抓取限制,最直接的做法是看抓取日志里搜索引擎实际请求了哪些地址、返回了什么状态码,再和robots.txt、页面meta robots、服务器规则逐条对照。重点不是“有没有写规则”,而是“规则是否真的拦住了不该拦的地址”。时间和人手有限时,先查返回403、404、429、503的抓取记录,这几类状态最容易说明限制存在。
抓取限制可能出现在四个位置,排查顺序应从外到内:
noindex或nofollow,这类标签影响的是索引与链接跟踪,不等于禁止抓取。判断依据是状态码和响应体。如果日志显示200且正文完整,说明抓取未被限制;如果显示403或429,说明请求被拒绝或限流;如果显示200但正文为空,可能是渲染或登录问题,而不是robots限制。
假设站点日志中某目录连续出现429,同时robots.txt里该目录是Allow,那么限制更可能来自服务器限流,而不是robots规则。此时先看限流阈值是否按IP或User-Agent设置,再决定是否放宽频率或调整抓取节奏。
可执行的核对步骤:
改动后,如果目标URL的抓取状态从403或429变为200,且正文长度与浏览器访问一致,可以认为限制已解除。但一次改动前后比较要考虑季节、搜索需求变化和数据采集差异,不能只看单日抓取量上升就断定规则生效。
验收时重点看三项:
如果状态码仍为403,但robots.txt和meta robots都未限制,应继续查防火墙、CDN或WAF规则,而不是反复修改robots.txt。
优先处理影响面最大的限制:先看robots.txt是否误封全站或核心目录,再看服务器是否对主流抓取工具统一返回403。页面级noindex虽然常见,但它影响索引而非抓取,可以排在服务器限制之后处理。
下一步:从日志中导出最近7天状态码非200的抓取记录,按路径归类,先解决出现次数最多且属于核心内容的那一类。