搜狗收录查询出现异常时,先不要急着改代码。正确做法是把异常拆成三层:整站层、目录层、单页层。用同一批查询条件分别核对,看异常是全部页面都不收录,还是只有某个目录、某类模板或某几个URL有问题。范围定下来,原因排查才有方向。
要查什么:查询时用的域名、协议、是否带www、是否带结尾斜杠。怎么查:把同一组URL分别用带www和不带www的形式查询,记录结果差异。结果说明什么:如果只有一种形式异常,问题可能在域名规范或跳转配置,而不是整站被降权。这一步必须先做,否则后面所有对比都不可靠。
要查什么:站点地图里提交的URL总量,以及其中能查到收录的比例。怎么查:从站点地图抽取若干条URL,覆盖首页、栏目页、内容页、标签页,逐条查询并记录。结果说明什么:如果各类页面都查不到,影响范围是整站级;如果只有内容页查不到,范围收窄到模板或内容层。注意站点地图只表示你希望被收录,不保证收录,所以它只能作为样本来源,不能当作收录依据。
要查什么:不同目录、不同模板的收录差异。怎么查:列出主要目录,例如文章目录、产品目录、标签目录,各抽5到10条URL查询,做成简单表格对比。结果说明什么:
要查什么:robots.txt是否屏蔽了相关目录,页面返回状态码是否正常。怎么查:直接打开robots.txt查看Disallow规则,再用抓取工具或命令行查看目标URL的HTTP状态。结果说明什么:如果robots.txt屏蔽了目录,抓取会被限制,但要注意,robots.txt的抓取限制不等于可靠的索引移除,已经存在的索引不一定因此消失。如果页面返回404或5xx,收录异常的原因就更明确,属于可定位的抓取失败。
要查什么:用页面标题、正文中的独特句子、完整URL分别查询。怎么查:选一段页面独有的文字做精确查询,看是否能定位到该页。结果说明什么:如果能通过独特句子找到,说明页面已进入索引,只是用某些查询词查不到,问题在查询方式而非收录状态;如果多种方式都找不到,才更可能是未收录。这一步能避免把查询误差误判为收录故障。
把上面每一步的结果写成一行记录:URL、查询形式、查询结果、状态码、robots状态、判断。范围判断标准可以简化为:整站多数样本异常按整站处理;单一目录异常按目录处理;少量URL异常按单页处理。HTTPS只说明传输加密,不保证页面安全无漏洞,也不保证收录或排名,所以不要把协议当成收录异常的通用解释。
下一步:从异常最集中的那一层选3条代表性URL,按“查询条件—抓取状态—robots限制—页面内容”的顺序逐项复核,确认一个可复现的原因后再动手修改。