先给结论:自动导出遗漏分页,通常不是“软件坏了”,而是导出范围、分页游标或站点自身分页结构三者之一发生了变化。要检查完整性,最可靠的动作是换一种独立路径重新取一份样本,与自动导出结果做交集和差集比对,而不是反复重跑同一个导出任务。如果两次独立路径的结果一致,说明问题在站点侧;如果只有自动路径缺页,才需要动导出配置。
发现遗漏后,不要立刻删任务重建。先看遗漏是否可复现:
三者的分界线是“遗漏是否稳定复现”。偶发用保留,稳定且可定位用改写,结构性不兼容才退出。
重跑同一个任务只能证明它是否稳定,不能证明它是否完整。更有效的做法是另取一份参照:
如果差集里的URL集中在分页边界(例如每页20条却总在第5页后中断),问题是分页推进;如果散落且无规律,问题更可能在抓取超时或去重规则。这个判断会直接决定下一步是调分页参数还是调超时与去重设置。
很多工具会同时给出“匹配总数”和“已导出条数”。用总页数 × 每页条数估算理论上限,再和实际导出量对比。注意:这个估算只用于发现量级异常,不能当作精确校验,因为末页通常不满、去重也会减少条数。
遗漏最常见的位置就是末页和倒数第二页。检查导出结果里是否存在最后一页应有的少量记录。如果末页为空而总数又对不上,多半是分页终止条件写错了。
部分工具按URL去重。当分页URL带有会话参数、时间戳或排序参数时,不同页可能被误判为同一页而只保留一份。核对导出URL里是否混入了这类参数,是区分“没抓到”和“抓到了但被丢掉”的关键证据。
假设某工具按每页50条导出,站点实际有320条,理论上应有7页。自动导出只拿到250条。此时:
这个对比不需要一次跑全量,取前100条做小样本即可,成本低且能快速分流。
检查的目的不是追求100%抓全,而是判断当前数据能否支撑下一步。如果遗漏集中在长尾分页、且业务只依赖头部页面,可以保留任务并标注已知缺口;如果遗漏落在核心分类,就必须先修复导出再用于分析。把“已确认完整”“已知缺口但可接受”“缺口影响结论”三种状态写进交付说明,比单纯报告条数更有用。
最后提醒一点:请求量或抓取量突然归零,不能单独证明导出处理正确——它也可能是站点限流、任务被暂停或筛选条件被改动的结果。要结合上面的差集比对一起看,才能得出可靠结论。