当一批结构相似的页面只有一部分被百度发现,对照组的意义不是证明“哪个操作有效”,而是把差异缩到少数几个可验证的条件上。更稳妥的做法是:先按页面自身特征分层,再在每一层内做保留、改写、退出三种取舍,而不是把全站页面混在一起比较。
批量页面只有一部分被发现,常见原因并不在页面质量,而在入口和抓取路径。百度发现一个 URL 通常依赖站内链接、站点地图、外部链接或历史抓取记录。如果这些入口对不同页面并不均等,那么“被发现比例低”可能只是入口分配不均,而不是内容本身有问题。
判断时可以先看三组证据:
如果日志显示蜘蛛从未访问某批 URL,那么问题更可能在入口,而不是内容。如果蜘蛛访问过但未收录,才需要进一步看页面本身。
对照组要能回答“差异来自哪里”,所以分层维度必须和假设对应。假设是入口不足,就按入口强弱分层;假设是内容重复,就按内容相似度分层。常见的分层方式有三种:
分层之后,每一层内部再决定保留、改写还是退出。保留适用于入口条件正常、页面内容有独立价值的 URL;改写适用于模板重复度高、正文信息不足的页面;退出适用于参数组合、筛选结果或已无实际内容的页面。
保留的前提是:该页面有独立搜索需求,且站内已有稳定入口。此时不需要改动页面,只需补强入口,例如从相关栏目页或正文中增加指向它的链接。动作之后观察日志中该 URL 的抓取频次是否变化,再决定是否进入下一轮。
改写的前提是:页面已被抓取但未收录,且与同批页面高度相似。改写应集中在标题、首段和核心信息,而不是全站模板。改写后不要立即批量提交,先让其中一小部分通过站内链接重新暴露,观察抓取和收录是否出现分化。
退出的前提是:页面没有独立搜索价值,或属于无限参数组合。退出可以用 404 或 301 指向最相关的保留页,但要注意 robots.txt 的抓取限制不等于可靠的索引移除;如果页面已经被收录,仅靠 robots.txt 阻止抓取通常不会让它从结果中消失。退出动作的结果应通过日志和结果页双重确认,而不是只看抓取量下降。
假设某站有 300 个商品筛选页,其中 80 个被发现,220 个未发现。按入口深度分层后发现,被发现的 80 个都出现在分类页前两页,未发现的多数只在筛选参数组合中可达。此时对照组可以这样划分:A 组保留 20 个有独立需求的筛选页,并从分类页直接链接;B 组改写 20 个重复度高的筛选页,合并为更少的静态页;C 组退出 20 个无需求的参数组合,用 301 指向对应分类页。
观察时不要只看“收录数量是否上升”,还要看被抓取的是不是目标 URL、返回状态是否正确、保留页的入口是否稳定。如果 A 组抓取增加而 B 组没有变化,说明入口是主要限制;如果 B 组改写后仍未被收录,则需要重新检查内容差异是否足够,而不是继续加链接。
抓取量、请求量或某个统计归零,不能单独证明处理正确。抓取量下降也可能是因为蜘蛛转向了其他目录,或站点整体抓取预算被重新分配。站点地图不保证收录,HTTPS 也不保证安全无漏洞或排名。真正能支持下一步决策的,是同一分层内不同处理组的对比结果:哪一组被抓取、被抓取后是否收录、入口是否稳定。
当批量页面只有一部分被发现时,划分对照组的核心不是追求整齐,而是让每个组只差一个条件。保留、改写或退出三种取舍,都应在明确前提后执行,并用日志和结果页验证,再决定是否扩大处理范围。