确定收录异常影响范围,核心是沿着“可抓取—可索引—已收录—可展现”四层逐级缩小边界:先用站点级指令排除全站屏蔽,再按目录、模板、参数分组抽样,最后对照索引状态与流量变化,判断问题是全站性、模板性还是个别页面。时间和人手有限时,优先处理全站屏蔽和核心目录,再处理长尾页面。
要查的是 robots.txt 和页面级 meta 指令是否误伤了整站。打开 robots.txt,检查是否存在 Disallow: /;再抽查首页、一个栏目页、一个详情页的 HTML 源码,看是否出现 <meta name="robots" content="noindex">。
判断结果:如果全站被 Disallow,影响范围是全站抓取,优先修指令;如果只有部分模板带 noindex,影响范围是该模板生成的所有页面。注意,robots.txt 限制抓取并不等于可靠的索引移除,被屏蔽的页面仍可能因外部链接出现在索引中,所以不能用它来精确控制收录。
要查的是异常集中在哪些 URL 模式。从日志或站长后台导出近期被抓取和已收录的 URL,按路径前缀分组,例如 /product/、/news/、/tag/,每组抽 5 到 10 条,逐条查索引状态。
判断结果:如果同一目录下多数页面都未收录,影响范围是该目录或对应模板;如果只有带特定参数的 URL 异常,例如 ?page= 或 ?sort=,范围是参数页;如果各目录都有零星异常,更可能是内容质量或外链问题,而非技术屏蔽。抽样时记录 URL、模板、最后抓取时间三列,便于横向比较。
要查的是提交的 URL 与实际收录的差距。把 sitemap 中的 URL 数量、索引覆盖报告中的“已编入索引”和“已发现但未编入索引”数量分别记下,按目录汇总。
判断结果:如果“已发现但未编入索引”集中在某目录,说明抓取正常但索引未通过,范围偏内容与质量;如果大量 URL 长期停留在“已发现”,可能是内链不足或站点权重分散。站点地图只是提交线索,不保证收录,所以它和实际索引的差值才是判断范围的关键依据。
要查的是异常究竟发生在哪一层。用 site: 查询只能粗略看索引量,不能当作精确收录数;再配合搜索表现数据看展现和点击是否同步下滑。
判断结果:三层现象对应不同处理顺序。抓取问题优先修服务器和指令,索引问题优先修模板和内容,展现问题优先修页面要素。不要因为展现下滑就断定收录出了问题。
要查的是异常出现前后有哪些改动。取异常目录和正常目录各一组 URL,对比上线时间、模板版本、canonical、内链数量。如果异常目录在某个时间点集中改版,范围大概率与该次改版相关。
假设某站点在改版后 /product/ 目录收录下降,而 /news/ 正常,抽查发现 product 模板新增了 noindex,那么影响范围就是该模板下的全部商品页,而不是全站。这个例子用于说明对比方法,不代表真实项目结果。
检查项清单:robots.txt 是否屏蔽、meta robots 是否 noindex、canonical 是否指向他页、服务器是否返回 5xx、sitemap 是否包含异常目录、内链是否可达、内容是否与其他页高度重复。每项记录“查什么、怎么查、结果说明什么”,即可在有限人手内排出处理优先级。
下一步:按上述五步填一张影响范围表,把异常 URL 按目录和模板归类,先处理覆盖页面最多、修复成本最低的一项,再观察索引覆盖报告的变化。