收录检查的正常与异常,不能只看“有没有结果”。判断标准是:查询方式是否指向目标页面、返回内容是否与页面实际内容一致、状态是否可重复。正常结果是“目标URL能被搜到,且摘要、标题、快照时间与页面基本一致”;异常结果是“搜不到、搜到的是另一条URL、摘要明显过时或内容不符”。下面用一个假设例子说明怎么查、怎么区分。
假设你负责一个企业站,同事提交了一篇新页面 /guide/install.html,要求确认是否被收录。你直接搜标题,首页出现的是栏目页 /guide/,没有目标页。这时不能立刻判定“未收录”,因为可能是标题被聚合页复用、目标页权重低,或查询词与页面文本不匹配。
正确做法分三步:
site:example.com/guide/install.html。如果返回该URL,说明至少已被索引;如果返回的是其他URL,属于“部分匹配”,不算目标页正常收录。满足以下条件越多,越接近正常收录:
注意:HTTPS只说明传输加密,不代表页面没有漏洞,也不等于一定被收录或排名靠前。站点地图能帮助发现URL,但不保证收录。robots.txt禁止抓取可以阻止爬虫访问,却不是可靠的索引移除手段——已收录页面仍可能因外链或历史记录出现在结果中。
异常不等于“完全没出现”,要按现象分类:
noindex 标记。若都没问题,可能只是尚未被抓取,需要等待或通过站内链接、站点地图提交发现。rel=canonical 是否指向首选URL,以及站内是否混用了多个版本。收录检查最容易返工的地方,是不同人用了不同查询词,却把结果当成同一结论。建议交付时固定记录四项:目标URL、查询方式(完整URL、独有句子或标题)、返回URL、判断结论。结论只写“正常收录”“部分匹配”“未发现收录”“需复查”四种,并附上检查时间。
如果同事只发来一句“没收录”,要求补充:查的是哪个URL、用什么词查的、返回了什么。没有这三项,无法判断是页面问题、查询方式问题,还是只是尚未被抓取。不同搜索引擎的收录范围和支持情况要分别核查,不能用一个引擎的结果直接推断另一个。
下一步:挑一个你负责的页面,用完整URL和一句独有正文各查一次,把两次返回的URL和摘要记在同一行里。两次都指向目标URL且内容一致,才算正常;只出现一次或指向别处,按上面的异常类型继续查。