检查百度爬虫在移动端与桌面端的差异,核心不是看它“像不像手机”,而是对比同一 URL 在两套 UA 下返回的 HTML、状态码、重定向和可抓取资源是否一致。时间和人手有限时,先处理返回内容不同、移动端被拦截、关键内容只在桌面端出现这三类问题,再去看细节样式。
百度搜索的抓取与移动适配涉及不同 UA 标识,具体字符串会变化,不应把某一个 UA 当成永久固定值。可靠做法是从服务器访问日志或 CDN 日志中,找出近期真实出现过的百度相关 UA,再用这些 UA 做对比测试。若日志里只有桌面 UA、没有移动 UA,问题可能出在抓取覆盖,而不是渲染差异。
适用条件:你能拿到站点日志或至少能自定义请求头。若只能看页面源码,检查范围会缩小到“返回内容是否不同”,无法确认百度实际抓取频次。
对同一个 URL 分别用桌面 UA 和移动 UA 发起请求,记录以下内容:
可以用命令行快速对比,例如:
curl -A "桌面UA" -I https://example.com/page
curl -A "移动UA" -I https://example.com/page
把 -I 换成 -o 保存正文,再逐项比对。例子中的域名是占位,需替换成自己的 URL。
把发现的问题分成三类,处理顺序不同:
注意:robots.txt 的抓取限制不等于可靠的索引移除。即使移动端被 robots 屏蔽,页面仍可能以其他方式出现在结果中,所以不要把它当作内容下架手段。
完成调整后,重新用两组 UA 请求同一 URL,确认:状态码一致且为可抓取状态;最终 URL 一致或跳转合理;移动端 HTML 包含与桌面端等价的核心正文和主要链接;CSS、JS 返回正常。若使用站点地图,它只能帮助发现 URL,不保证收录,因此验收仍以实际抓取和返回内容为准。
HTTPS 也不等于安全无漏洞或排名保证,它只说明传输层加密,不能替代内容一致性检查。
选 5 到 10 个代表页面,覆盖首页、栏目页、详情页和重要落地页,按上面的四个信号逐项记录。每次改模板、改 CDN 规则或改 robots.txt 后重跑一次,就能在有限人力下持续发现移动端与桌面端的抓取差异。