区分抓取、索引和排名,最直接的方法是看页面在搜索链路中的状态:抓取是搜索引擎发现并读取页面,索引是把可用的页面内容存入可供检索的库,排名是用户搜索某个词时,搜索引擎从索引中挑出页面并决定展示顺序。三者是先后关系,不是同一件事。第一次接触时,先不要问“为什么没排名”,而要先确认页面有没有被抓取、有没有被索引,最后才轮到排名。
抓取解决“搜索引擎能不能拿到这个页面”。它关注的是链接是否可发现、服务器是否正常响应、页面是否被规则挡住。索引解决“拿到之后要不要收、收得对不对”。它关注内容是否可读、是否重复、是否值得进入候选库。排名解决“进入候选库后,在某个查询下排第几”。它关注相关性、内容质量、用户体验和竞争程度。
把这三步混在一起,最常见的误判是:页面没被索引,却一直去改标题和正文想提升排名;或者页面已经被索引,却反复检查抓取日志,以为抓取有问题。判断起点错了,后面的动作基本无效。
可以按下面顺序做一次检查,每一步只回答一个是非问题:
site:加具体页面地址查询,看能否返回该页面。能返回,通常说明已进入索引;不能返回,只能说明当前查询没展示,不能单独断定未索引。robots.txt是否屏蔽了该路径,页面HTML中是否写了<meta name="robots" content="noindex">。如果写了noindex,页面即使被抓取也可能不进索引。这套顺序的适用条件是:你有一个明确的目标页面和目标查询。如果只是泛泛看整站流量,不能直接得出某一环节的结论。
搜索不到页面,可能有多种解释:页面未被抓取、被抓取但未索引、已索引但该查询下不展示、或者展示在较后位置而你没翻到。它不一定是排名差,也不一定是被惩罚。
页面能被搜索到,但目标词下不出现,更可能是排名环节的问题,而不是抓取或索引。此时再去看标题、正文相关性、内链和竞争页面,才有意义。
页面内容与搜索摘要不一致,可能涉及索引版本较旧或渲染差异。可以先确认搜索引擎读取到的版本,再判断是抓取内容问题还是索引更新问题。
如果检查后确认页面可抓取、无noindex、返回200、正文可读,那么抓取和索引的基础条件基本具备。接下来用具体查询观察展示情况,才进入排名判断。
如果发现robots.txt屏蔽或页面写了noindex,先修正这些设置,再等待搜索引擎重新处理。这里的“等待”没有固定时长,取决于搜索引擎的再抓取节奏,不能承诺具体见效时间。
如果页面已被索引但目标查询下排名不理想,下一步不是继续检查抓取,而是对比同一查询下已排在前面的页面:它们覆盖了哪些子主题、内容深度如何、页面体验是否更完整。这样才把问题落到排名环节。
第一次接触这个问题,建议只选一个目标页面和一个具体查询,按上面的顺序走一遍。先记录页面能否被抓取、能否被索引、在该查询下是否出现,再决定下一步优化动作。这样比同时改标题、改正文、改内链更容易看清是哪一环起了变化。