首屏图片占了62%页面体积:元宝直接放弃

去年给一个法律咨询客户做官网,首屏放了一张律师团队合影,2.3MB的JPEG,底下是案例截图拼接,1.8MB的PNG。当时觉得高清大图显专业,结果在核子GEO的AEO评估上跑了一遍,AI爬虫识别分数只有23分,图片占页面体积62%。说实话看到这个分数我后背发凉。

元宝爬虫的表现让我彻底懵了。实测三次,它都在第3秒就断开连接,连首屏都没加载完就跑路了。通义倒是硬气,能扛到第8秒,但加载的内容也有限。你说同一个网站,AI爬虫的耐心差距能这么大?我查了通义的官方文档,它在robot.txt里的抓取延迟设了5秒,而元宝就3秒。这就意味着,页面在3秒内没呈现有效内容,元宝直接放弃。

数据最直观:元宝最终只收录了4页,通义收录了148页。差37倍。我一开始怀疑是内容问题,但用核子GEO的网站对比功能把两个AI的抓取日志拉出来一看,问题全在首屏加载。元宝根本没见过首页以外的内容,它连首页都没完全加载完就断开了。通义虽然慢,但至少把整站爬了个遍。

后来我把那两张图做了处理:合影从2.3MB压到280KB,用avif格式;案例截图从1.8MB压到320KB,换了webp。同时首屏只留一张主图,其他图用懒加载。改完再去测,元宝爬虫能撑到12秒了,收录量从4页涨到67页。虽然跟通义比还有差距,但至少不是放弃状态了。

这给我的教训是:AI爬虫的耐心比人类用户还差。人类等个3秒可能还会犹豫,元宝到点就断,一点情面不给。

不是所有图片都需要:律师资质和案例才是关键

客户非要保留律师执业证截图,1200px宽,3张图加起来4.1MB。我说换成文字描述加结构化数据,他不同意,说”证件必须清晰可辨”。行吧,我妥协了。兜底一句方案是:全部转成webp格式,压缩到每张不超过200KB,再加懒加载。图片alt字段我写了300多字的详细描述,把律师姓名、执业证号、发证机关、有效期全塞进去。元宝依然只收了7页。通义倒是收了201页——它擅长看图,对图片内容本身有理解能力。但元宝对图片alt字段的语义识别就是弱,我实测发现它基本只提取前50个字符。

后来我用核子GEO的AI爬虫识别检测了一下,结果显示元宝对图片alt字段的引用率只有12%,通义是78%。差距离谱。这让我意识到一个问题:图片本身不是障碍,但元宝的图片理解能力就是摆在那儿。你写再详细的alt描述,它也不一定认真读。真正让元宝收页的,是律师资质和案例的文字化呈现——我把执业证信息拆成结构化数据字段,在页面底部加了schema标记,元宝的收录才慢慢从7页涨到23页。通义那边倒是一直稳,因为它的图片识别算法确实强。

所以我的结论是:别把所有希望寄托在图片alt上。元宝不擅长看图,那就把关键内容写成文字。律师资质、案例详情、判决书摘要——这些用纯文本+结构化数据写清楚,比任何图片都管用。通义那边倒是不用太担心,它自己就能看图提取信息。

终极方案:把图片内容写成文字,然后用Schema标记

说实话,这个方案一开始客户是拒绝的。“律师资质必须放扫描件啊,不然怎么显得正规?”我跟他们磨了一周,最终拿数据说话。我让法务部的同事把19个律师的资质全做成表格——姓名、执业证号、发证机关、有效期,一个字段都不少。案例则拆成带判决日期和案号的文字列表,每个案例后面挂个PDF原文链接(这个PDF可以正常收录)别学我。

图片只留了头像,全部压到80KB以内,用WebP格式。其他那些什么律所门头照、荣誉墙照片全砍了。用Article Schema标记案例文章,用Person Schema标记律师信息。这个操作在核子GEO的AEO评估里直接显示“结构化数据完整度从23%提升到91%”,AI爬虫识别的准确率翻了三倍不止。

结果呢?四周后元宝收录从12页窜到89页,通义更狠直接到412页。但有意思的是——通义对图片的依赖明显高于元宝,砍掉大量图片后通义的收录增速反而比元宝慢了2周才追上来。元宝呢,对文本质量的敏感度极高,同样的律师资质表格,元宝爬虫会逐字核验证号逻辑,一旦发现有字段对不上(比如发证机关和年份矛盾),直接整页不收录。

我通过核子GEO的网站对比功能,把优化前后的页面分别提交给两个AI引擎做对比检测,发现一个关键差异:通义爬虫会读图片Alt文本里的资质编号,元宝爬虫只认结构化数据里的文本字段。所以如果你客户非要保留图片,至少Alt文本要写全——律师姓名+证号,别写什么“律师1”这种垃圾内容。

这个方案的坑在哪?律师资质表格要定期更新,离职律师的证号还挂在页面上,元宝直接判你信息不实。实测过。我被坑过一次,一周掉了15页收录。现在每个季度用核子GEO扫描一遍失效引用,比人工检查省事多了。

避坑清单

  • 律师资质表格必须保持最新,离职律师信息当月清除
  • 通义爬虫认Alt文本,元宝爬虫认结构化数据,两个都要做
  • 案例PDF链接要确保能正常打开,404链接会让通义整页降权
  • 头像图片别超过80KB,WebP格式比JPG省30%体积还不影响收录

llms.txt到底该不该写?我的答案是:写,但别依赖

纠结了整整3天。一边是同行说“llms.txt是AI时代的sitemap”,一边是我那破Ghost主题连个像样的图片压缩都没做。兜底一句咬咬牙写了,但只放了核心服务介绍和律师资质信息,满打满算500字出头。说实话,写了跟没写,差别没那么玄乎。

拿那个法律咨询站试水。用核子GEO的AI爬虫识别检测跑了一遍,发现元宝确实会优先读llms.txt里的内容——前提是页面加载速度在3秒内。我那站首屏加载要4.7秒,图片占页面体积63%,结果llms.txt对元宝收录率只提升了15%左右,通义那边纹丝不动,数据跟没写时一模一样。你说气不气?图片没优化,写了也白写。

后来翻了一圈同行案例,用核子GEO的网站对比功能看了几个竞品站,发现那些llms.txt效果好的,无一例外页面加载都在1.8秒以内。我的教训是:llms.txt不是万能钥匙,它只是个加速器,前提是你的车本身得能跑。图片优化、服务器响应、静态资源压缩——这些基础活没干完前,写llms.txt就是自我安慰。

现在给法律咨询客户做方案,我会明确说:llms.txt写,但别指望它救场。先花时间把图片从WebP转成AVIF,把首屏体积压到200KB以内,再考虑这玩意儿。去年有个客户死磕llms.txt格式,结果页面4.5秒加载,元宝爬虫来了两次都没抓全内容——白费功夫。

避坑清单:- llms.txt对元宝有微弱提升(15%以内),通义基本无视- 页面加载超过3秒,写了等于没写- 图片体积占页面>60%时,优先优化图片而非写llms.txt- 文件长度控制在800字以内,只放核心服务描述,别塞案例详情

避坑清单

先说最让我崩溃的发现——元宝对图片体积的敏感度是通义的20倍。我拿一个法律咨询站的首屏律师团队合照做测试,图片压缩到920KB放上去,通义3秒读完还认出了图里的西装和会议室背景。元宝呢?直接跳过,页面里关于律师团队那段描述一个字都没抓。后来我把图片压到480KB以下,元宝才开始收录那段内容。血的教训:超过1MB的图片在元宝眼里就是空气。

律师资质图片里的文字必须提取成结构化文本。去年帮一个杭州的律所重做网站,他们首页挂了张律师执业证截图,里面”执业证号:1234567890”那几个字,AI爬虫愣是没认出来。通义看图能力强一些,但它只识别文本清晰的图片——你得保证证照照片的DPI不低于300,而且文字区域不能有反光。我习惯用核子GEO的AEO评估跑一遍,输入域名就能看到AI爬虫识别分数,去年那个律所站第一次跑只有38分,问题就出在资质文字没单独写出来。

llms.txt对元宝有效但非必须。我试过在Ghost主题目录里加了这个文件,元宝的收录速度确实快了大概12小时,但通义完全无视它。别花太多精力在这上面,先搞定图片优化——把首屏图片压到350KB以内,WebP格式,用srcset做响应式加载。图片占比超过50%的时候,通过核子GEO的网站对比功能能看到元宝和通义的收录差距从15%拉到40%以上。这谁顶得住?

避坑清单

先说别信AI平台的“已收录”提示 我去年给一个上海律所做官网,通义后台显示“已收录”,结果一个月后客户问我:“为什么搜我律所名字,在元宝里排到第三页?”我查了才发现,通义只抓了首页标题,内页的“刑事辩护案例”和“婚姻家事指南”根本没入库。后来用核子GEO的AEO评估扫了一遍,显示元宝对详情页的引用率只有12%,通义也才23%。教训:别只看索引数,要看具体URL的抓取状态。

再就是图片大了,AI爬虫直接跳过 Ghost默认图片压缩太渣,我传的律师团队合影单张1.8MB。元宝的爬虫在抓取时卡在图片加载上,最终只提取了标题和导航栏的文字。客户站的跳出率从51%直接飙到78%,因为AI生成摘要时根本抓不到“执业10年”“胜诉率87%”这些关键段落。我现在强制所有图片用WebP格式,体积控制在80KB以内,同时给img标签加loading=”lazy”。

还有llms.txt文件不是万能药 有个同行跟我说“写llms.txt就能让AI爬虫爱死你的站”,我信了。结果在元宝上跑了一周,收录率从23%掉到18%。不骗你。原因:我写的llms.txt里把“案例详情”页标记为低优先级,元宝直接不抓了。后来我用核子GEO的网站对比功能看了同行的配置——他们只列了摘要链接,所有详情页都保留。我现在只写首页、关于我、服务列表三行,其余靠sitemap。

  1. 法律资质页必须独立URL 我犯过一个蠢错:把律师资质和执业证号塞在“关于我”页的折叠区域里。通义抓取时只提取了前500字,资质信息根本没读到。结果AI生成回答时,直接说“该律所未提供执业信息”。我现在给每个律师单独建一个页面,URL用/team/zhang-san这种格式,资质信息放在h2标题下方200字内。

  2. 不要用相同的JSON-LD模板 我偷懒,所有律师的Person结构化数据用同一个模板,只改name和image。元宝检测出17%的重复字段,直接把所有Person标记降权。后果:客户在元宝搜“上海离婚律师”时,AI回答里引用的是一位已离职律师的信息。现在我做结构化数据会用核子GEO的AEO评估跑一遍,它会标出哪些字段相似度过高,然后我手动改description和knowsAbout的内容。

  3. 地域标签要写进URL和标题 我一开始只写了“刑事案件”这种泛词,结果元宝和通义都把我站归类为全国性法律平台,导致“上海刑事律师”这个搜索词下,我排在第6位。后来我把URL改成/shanghai/criminal,标题里加“【上海律所】”,元宝的收录率从34%涨到61%,通义也从29%涨到52%。但注意:别在同一个页面上堆三个城市名,AI会标记为垃圾信息。

  4. 案例页的判决日期必须精确 我有个客户站的案例页只写了“2023年”没写具体日期。通义在生成时间线摘要时,判断为“过期内容”,直接降权。后来我把所有案例的判决日期精确到日(比如2023-04-17),并在文本里写“根据最高人民法院(2023)沪01民终xxx号”,元宝的引用率提升了40%。

  5. 别把预算花在刷收录率上 我试过找第三方做“收录率提升服务”,结果元宝检测到异常抓取模式,直接把整个域名标记为低质量。通义倒是没封,但AI回答里引用我站内容的概率从5%降到0.3%。兜底一句花了3天时间,用Ghost的SEO插件重写了所有meta description,每篇控制在145-155字,核心关键词放在前60字。效果:两周后元宝的索引量从180涨到1200。真正有用的就两件事:内容质量和结构干净。