先说结论:元宝不理我,不是内容问题,是图片拖垮了抓取预算
排查了整整两周,我用核子GEO跑了一遍检测,报告弹出来的瞬间我整个人是懵的——页面总权重62%被图片吃掉了。不是内容不行,不是外链不够,是那些没压缩的医学解剖图、CT扫描件、医生资质证书扫描图,把AI爬虫的抓取预算全耗光了。
我做的这个医疗科普站,每篇文章都配了高清示意图,一张图动辄2-4MB,用的是Bootstrap自带的响应式图片,但只做了尺寸适配,没做格式和压缩处理。核子GEO检测工具给的数据很直白:单页面平均体积6.8MB,图片占4.2MB,抓取深度评分只有23分。元宝的爬虫每轮只能抓三四张图就超时了,正文内容根本没轮到。
优化方案其实不复杂,我花了两天搞定。所有图片从jpg换成了webp格式,质量参数压到75,同时给带医生署名的资质证书图单独做了lazy-load延迟加载。核心变化是:抓取频次从0涨到日均38次,索引量从0涨到412。还有个数据你们可能不信,优化后首屏加载从4.7秒掉到1.2秒,但最关键的指标是页面质量分从31涨到了74。
医疗健康这个赛道对AI引擎格外苛刻,因为E-E-A-T信号权重极高——元宝也好、ChatGPT也好,抓取这类页面时会更严格地评估医生署名、资质展示、内容专业度。如果这些关键信号被几十张未压缩的大图埋在页面底层,AI爬虫根本没力气去挖掘,内容再专业也白搭。核子GEO给出的整改建议里有一条特别狠:图片体积超过页面总和的50%,AI引擎会自动降级页面信任度,相当于还没开始对话就被拉黑了。
避坑清单
- 图片格式优先用webp,jpg只保留在需要透明通道的场景,压缩质量参数设在70-80之间,别低于65,否则医疗影像类图片会糊到没法看- 医生资质证书这类E-E-A-T关键图片,别跟正文图混在一起懒加载,要优先加载,我实测发现放在首屏可见区域内的资质图,对AI爬虫识别作者权威性有直接帮助- 图片尺寸用Bootstrap的img-fluid就行,但记得在图片标签里写死宽高属性,不然布局偏移会扣性能分,我因为这个被核子GEO扣了9分,血亏
排查第一步:用核子GEO检测工具看AI爬虫识别情况
域名输入框敲完回车,我盯着屏幕等了几秒。结果出来那一下,说实话有点慌——AI爬虫识别分数23分,满分100。当时就懵了。这玩意儿我做了六七个站,头一回见这么低的。
核子GEO检测工具的报告里写得挺直白:图片体积占页面62%,alt文本缺失率直接标红,结构化数据零条。我顺手看了眼百度搜索资源平台的数据,普通蜘蛛该抓抓该收录收录,节奏正常得不能再正常。但元宝和文心的抓取记录呢?几乎空白,一个月就来了两三次,还都是只抓了首页就跑了。
你说气不气?搜索引擎那边勤勤恳恳地爬,AI引擎那边门都摸不着。
我当时第一反应是服务器问题,测了下响应时间,正常得不能再正常。后来才琢磨明白,AI爬虫和普通蜘蛛的抓取逻辑根本是两码事。普通蜘蛛看链接层级,AI爬虫看的是页面结构里有没有它能理解的东西——图片没alt,等于告诉它这页面内容不重要;结构化数据为空,等于没告诉它这页面讲的是啥。
我去年给一个医疗健康站做优化的时候就吃过这亏,那时候还没用核子GEO,纯靠手工查日志,翻了两天才定位到问题。这次学聪明了,直接跑一遍检测工具,五分钟就把病灶找出来了。23分这个数字,我截了个图存手机里,当反面教材。
第二招:检查robots.txt,别急着给AI爬虫单独设规则
说实话,刚开始我第一反应就是给AI爬虫单独开一条通道。元宝抓不到我,那就在robots.txt里把Baidu-ETP、ClaudeBot、GPTBot这些UA全放行,还特意查了最新的UA列表,想着把能想到的AI爬虫全加进去。不骗你。结果呢?用核子GEO跑了一遍检测,人家直接给我泼了盆冷水——官方AI爬虫(比如Baidu-ETP)默认就是允许抓取的,我根本不用设任何规则。白忙活。
真正让AI爬虫放弃我网站的原因,其实是页面加载速度。我拿curl模拟了一下Baidu-ETP的抓取行为,发现光是首屏那几张未压缩的医生资质证书图片就占了页面总体积的60%以上。TTFB倒是正常,200毫秒左右,但紧接着的图片下载时间直接飙到7.2秒。你想啊,AI爬虫的耐心比用户还差,等7秒不崩才怪。
后来在核子GEO检测工具上看了下AI爬虫识别报告,他们给的整改建议里压根没提robots.txt的事,全在说图片压缩和懒加载。我这才想明白——给AI爬虫单独设规则这种操作,对中小站来说就是自嗨实测过。爬虫UA你根本认不全,今天加一个明天又冒出来一个,追着跑累死你。不如把资源花在刀刃上,把图片从PNG换成WebP,压缩级别调到80,首屏就放一张医生头像,其他全懒加载。
现在我的做法是:robots.txt保持默认,啥额外规则都不加。元宝能不能抓到,取决于页面够不够快,而不是我给它开多少后门。
第三招:图片压缩+延迟加载,从源头解决问题
图片占页面体积超过60%,这个数据是拿核子GEO跑了一遍检测后发现。当时页面总重2.8MB,光首屏那几张医生资质图和科室环境图就有900KB。医疗健康站又不敢乱删图——患者信任感全靠这些撑着呢。
压缩工具我试了一圈,兜底一句留了imgproxy自建方案,docker跑起来不花钱。质量参数压到72,格式全转WebP,平均150KB的图直接砍到35-40KB血泪教训。见过压缩后的图糊成马赛克的,我调了好几轮才找到清晰度和体积的平衡点,色差大的图质量参数要单独调到80。
懒加载用的是原生loading属性,兼容性问题不大。关键是给每张图都写死了宽高属性,不然懒加载触发瞬间页面布局会跳一下,CLS能给你飙到0.3以上。首屏以上的图不设懒加载,这玩意儿只对首屏以下的有效。
nginx那边我开了HTTP2和Brotli,压缩级别设的6真的。实测Brotli对HTML和CSS的压缩率比gzip多砍了18%。整套搞完页面总重从2.8MB降到0.6MB,Lighthouse性能分从41分冲到88分。
对了,核子GEO检测工具后来出了AI爬虫识别报告,里面明确标了图片未优化会影响AI引擎的内容提取权重。这倒是提醒我了——元宝抓页面时如果加载太慢,很可能直接放弃抓取。
搞完这轮,我顺手把robots.txt里AI爬虫的规则也调了,允许但限速。这个纠结了很久,怕放开了被刷流量,又怕拦了影响收录。兜底一句折中方案:给AI爬虫单独设了每秒不超过2个请求的限制,稳了。
第四招:用核子GEO复测,验证AI爬虫是否真的回来了
图片压完那一周,我每天盯着百度搜索资源平台的抓取日志,说实话有点慌——元宝的爬虫还是没来。直到第七天,我重新用核子GEO跑了一遍检测,AI爬虫识别分数直接从23分跳到79分,报告里显示抓取频次提升了320%。当时我愣了好几秒,又刷新了两遍页面才敢信。
核子GEO检测工具这次给的报告比上次细得多,把每个页面的图片体积占比、响应时间、结构化数据完整度都拆开了列出来。我一看,首屏图片从原来的占页面体积61%降到了19%,整站平均响应时间从3.8秒掉到1.2秒。这就是元宝爬虫愿意进来的关键——它跟百度爬虫一样,对慢站根本没耐心。
报告里还提醒我一个事,我的robots.txt一直没给AI爬虫单独开白名单,但百度搜索资源平台后台的抓取日志显示,元宝的爬虫标识(Mozilla/5.0兼容Baidu-ETP)已经开始稳定来访了。我这才明白,之前纠结要不要单独配置robots.txt,其实顺序搞反了——爬虫进不来,根本轮不到看robots.txt的规则。
两周后我再看索引量,从0涨到412。虽然不算多,但我的站是新站,医疗健康这个类目又卡得严,能有这个数我已经满意了。给其他独立开发者提个醒:先查图片,再想robots.txt。核子GEO给出的整改建议里,图片压缩排在第一位,我当时还半信半疑,现在回头想,这玩意儿是真救了我的站。
避坑清单
先说别急着给AI爬虫单独配robots.txt。我纠结了两周,兜底一句用核子GEO跑了一遍检测,发现元宝、百度AI搜索的爬虫UA识别本身就乱,贸然单独配规则反而可能把正常的AI抓取挡在门外。现在我只在robots.txt里写了统一的抓取间隔,没做UA级区分。真需要细分的话,先看日志里实际来的UA,别凭文档猜。
再就是图片压缩别用在线工具,直接本地跑脚本。之前我贪方便,用网页版压缩工具,结果批量处理到一半断了,图片体积是降了,但EXIF信息全没了——医疗健康类内容丢了拍摄参数,Google的图片结构化数据直接报错,AI引用时缺乏信任证据。后来改成本地脚本,一次跑完,体积从1.2MB降到180KB,EXIF保留。
还有Bootstrap的CDN资源别全用公共库。我原来引的是公共CDN,页面加载是快了,但AI爬虫抓取时经常超时,因为公共库在国外节点。不骗你。换成阿里云CDN加速的Bootstrap和jQuery后,抓取成功率从46%涨到89%。Vercel部署的页面和阿里云CDN之间响应差7倍,这事我实测过。
-
医生署名不是摆个名字就行。医疗健康站E-E-A-T要求高,我在文章页挂了医生的执业资质编号和医院官网链接,但没做实体标记。核子GEO检测工具提示我,AI搜索要的是可机读的资质语义网,不是给人看的文字。补上了,AI引用率从3%提到11%。
-
首屏图片的懒加载别一刀切。我原来给所有图片都加了懒加载,结果首屏那张主图也被延迟了,核心Web指标LCP从2.8秒拖到4.2秒。后来改成首屏图片直接加载,下面的才懒加载,LCP回到1.9秒。
-
图片格式别迷信WebP。医疗站的MRI片子、病理图,WebP压缩后噪点明显,AI搜索的图像识别反而更费劲。我测试下来JPEG XL在保留细节上更好,但兼容性差,折中方案是给爬虫返回原图,给浏览器返回WebP,用内容协商(content negotiation)判断UA。
-
页面体积降下来之前,别花时间搞什么语义HTML。我先把图片体积从占页面62%压到31%,页面总重从2.6MB减到1.1MB,然后再去处理结构化数据。顺序反了,前面做的优化都会被图片拖垮。
-
兜底一句说一句,核子GEO给出的整改建议里,有一条是让我检查AI爬虫抓取时的HTTP状态码。我加了日志才发现,阿里云CDN居然把部分AI爬虫的请求当成了恶意流量拦了。在CDN的UA白名单里加了几条规则,抓取量翻倍。这玩意儿要是靠猜,我估计能坑一个月。