SEO诊断分析:怎样判断采集是否遗漏——用覆盖清单核对

📍 WDQWDWQD987AAAAA:216.73.217.99
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /e6b3e6ce6b1d.html
📄

SEO诊断分析:怎样判断采集是否遗漏——用覆盖清单核对

判断采集是否遗漏,不能只看“收录了多少条”,而要把应采集合集与实际采集合集做差集。做法是:先确定页面来源清单,再用站内日志、站点地图和数据库记录交叉比对,找出只出现在来源、却没有进入采集结果的URL。差集不为空,就说明存在遗漏;差集为空,也只能说明在本次口径下没有发现遗漏。

先定义“应采集”,否则无法判断遗漏

遗漏是相对目标集合而言的。多人协作时,最容易返工的地方就是每个人心里的“应采集”不一样。交付前先把口径写清楚:

这份口径就是后续判断遗漏的基准。没有它,任何“好像少了几条”都只是感觉。

观察:用三条证据链找差集

不要依赖单一指标。第三方估算流量、搜索引擎报告和站内统计口径不同,都不能单独还原采集全貌。可核对的做法是:

  1. 从来源侧导出URL清单,去重后得到集合A。
  2. 从采集侧导出已处理URL清单,得到集合B。
  3. 计算A减B,得到候选遗漏清单。

如果条件允许,再补两条证据:站点地图中的URL是否都出现在B中;站内日志里被访问过的URL是否都进入过采集流程。三条证据指向同一批URL时,遗漏判断的可信度最高。

判断:区分“真遗漏”和“口径差异”

差集里的URL不一定都是遗漏。逐条检查以下情况:

只有排除前两类后,剩下的才进入处理清单。把判断依据写进交付文档,能显著减少协作中的反复确认。

处理与复查:让遗漏可复现、可验证

对确认遗漏的URL,按原因分派处理:发现遗漏就补入口或补站点地图;抓取失败就重跑并记录错误;解析失败就修规则后重放。处理完不要只看“任务成功”,要重新计算一次差集:

A - B_new

如果结果为空,说明这批URL已进入采集结果;如果仍有剩余,检查它们是否属于口径外或仍处于重试队列。复查时保留处理前后的清单文件,标注每条的归属,方便他人复核。

多人协作时的交付检查项

下一步:选一个已有明确来源清单的小范围栏目,按上述步骤做一次差集核对,把口径、差集和处理记录整理成模板,再推广到全站。

图1 图2

nginx