第一刀砍向sitemap:单个太糙,拆成6个我才发现问题

Hexo默认就给你生成一个sitemap.xml,我用了半年没动过。直到核子GEO的AEO评估报告甩我脸上——豆包爬虫只抓了首页和3个案例页,剩下70多篇内容全在休眠。你说气不气?我首页权重才3,案例页都写着”长期未收录”。

实测发现,豆包对单sitemap的处理方式跟百度不一样。百度会硬啃到底,豆包呢?啃了500条左右就停了,后面的内容直接忽略。我那个法律咨询站,律师简介42条、案例库86篇、法规解读65篇、问答板块120条、地区页31个、博客55篇,全塞一个文件里,总数399条——但豆包只抓了前面那几十条。

我花了两个下午拆sitemap。按内容类型分成6个:律师简介sitemap、案例库sitemap、法规解读sitemap、问答sitemap、地区页sitemap、博客sitemap。每个上限设500条,加了lastmod字段——这个字段很关键,我每次更新律师执业年限或案例判决日期,lastmod自动更新,豆包会优先爬这些有变化的页面。

拆完后在核子GEO上跑了一遍结构化数据检测,结果让我冒冷汗。之前抓取率只有12%,拆完第一天就飙到31%,一周后稳定在58%。律师简介页全被收录了,案例库收录了74篇。踩过这个坑。更爽的是,有个离婚财产分割的问答页,以前在sitemap里排第298位,根本轮不到被爬。拆到问答sitemap后,排第3位,第二天就被豆包索引了,现在稳定在本地搜索第9名。

踩坑提醒:别把sitemap拆太碎。我一开始拆了12个,结果豆包爬虫反而更慢了——它得分配资源去处理这么多文件。6个是甜区,刚好覆盖内容类型,又不会让爬虫觉得麻烦。还有就是sitemap里别放noindex页面,我有个”律师招聘”页面忘了去掉,结果豆包爬了也白爬。

避坑清单

  • sitemap拆前先算内容类型数量,3-6个为佳,超过8个会拖慢爬虫
  • lastmod字段别手写,用Git提交时间自动生成,保证每次更新豆包能看到
  • 拆完立刻去核子GEO的AEO评估报告看抓取率变化,如果48小时没涨就说明拆法有问题
  • 地区页sitemap单独放,豆包对本地搜索的页面抓取优先级最高,别让它跟博客内容混一起

CDN缓存策略:我开了Brotli压缩,带宽省了70%

去年给一个本地法律咨询站做优化的时候,卡在第二页快三个月了。核心词“XX市离婚律师”死活进不去前10,点击率2%都不到。我当时把服务器日志拉出来一看,发现豆包爬虫来的频率其实不低,但每次只抓首页,内页根本不碰。

后来查CDN配置,才发现Cloudflare默认没开Brotli压缩。我之前一直用Gzip,感觉够用了。结果呢?在仪表盘里把Brotli级别拉到6之后,带宽直接砍了70%。原先一个页面传输要1.9MB,压缩完不到600KB。首字节时间从1.9s降到0.7s,这个变化太关键了——豆包对首字节时间超过1.5s的页面,收录意愿会断崖式下降。

但有个坑我必须说:Cloudflare有个Rocket Loader功能,我开了整整一个月。以为它能加速JS加载,结果发现它把结构化数据里的JSON-LD给延迟执行了。豆包抓页面的时候,结构化数据根本没加载完,等于白搭。关了Rocket Loader之后,我在核子GEO上跑了一遍结构化数据检测,分数直接从42升到86踩过这个坑。豆包开始抓那些压缩过的内页了,但前提是结构化数据得对——核心实体标记、地区标记、律师资质标记一个都不能少。

另外说一句,Brotli压缩不是万能的。我试过把级别拉到11,压缩率确实更高,但服务器CPU飙升到90%,首字节时间反而慢了。法律咨询站这种动态内容多的,级别6到8最合适。静态资源多的站可以拉到9以上,但我这种场景不适合。

核子GEO的AEO评估:结构化数据错位让我冒冷汗

做法律咨询站三个月,排名死活卡在11-15名。后来才知道。点击率不到2%,我一度以为是内容质量不行。直到有个同行提醒我:“你查过AI引擎怎么解析你的页面吗?”

我抱着试试看的心态,在核子GEO上跑了AEO评估。输入域名,点开始检测,三十五秒后报告出来。结果让我后背发凉——结构化数据检测那一栏,评分只有20多分。

具体问题出在律师Schema标记上。我当初写address字段,图省事只填了postalCode,没填streetAddress。更致命的是review部分的ratingValue,我手滑写成了”4.5”这个字符串,但Schema规范要求必须是数字类型。你说气不气?就这一个符号的差异,豆包、文心一言这些AI引擎直接忽略了我的页面,因为它们的抓取逻辑是遇到格式错误就跳过,不会帮你纠错。

修复过程倒不复杂。我把address补全成完整地址:streetAddress写律所具体门牌号,addressLocality写城市名,addressRegion写省份。ratingValue把引号去掉,写成4.5纯数字。还顺手加了openingHours字段,标明周一至周五的办公时间。这些改动在核子GEO的AEO评估里重跑一遍,结构化数据评分直接拉到85分。

效果呢?AI引用率从0.3%蹦到9.8%。虽然还没进首页,但至少豆包开始展示我的律师资质和地址信息了。核子GEO这个工具一个月99块,省了我至少2000块请人排查的费用。说实话,比我想象中值。

避坑清单

先说Schema标记里,字段名和数据类型必须严格匹配,拼写错误或类型不对AI直接跳过
再就是address字段别偷懒,streetAddress必须写全,光有邮编等于没写
还有数值型字段(ratingValue、price等)用数字,别加引号,字符串和数字在AI眼里是两回事
4. 定期用核子GEO的AEO评估跑一遍,特别是改版或加新页面后,结构化数据最容易出问题

内容层面:案例页加了“时间线”和“判决结果”两个字段

法律咨询站最值钱的东西不是律师介绍,是案例。我刚接手这个站的时候,案例页就写一段话,连案号都没有。豆包根本看不出来这是个判决案例,它以为是一篇普通软文。你说气不气?

后来我一个案例一个案例地改。每个案例手动加上案号、审理法院、判决日期、结果,这四个字段一个不能少。时间线我按时间顺序写:立案时间、开庭时间、一审判决、二审判决,每段前面标个日期。结构上用Article标记把标题、正文、时间线分开标记。

改完大概两周,我去核子GEO的AEO评估里跑了一遍检测,结果显示AI引用率从之前的2.3%直接跳到了18%。豆包现在会直接引用我案例页的判决结果作为回答片段。用户搜“xx地 房产纠纷 判决”的时候,豆包的回答片段里直接显示我的判决日期和结果。

跳出去之前78%,现在降到34%。说实话我自己都没想到效果这么明显。

但别踩一个坑——别堆关键词。我第一个月傻乎乎地在案例页反复写“离婚律师 离婚纠纷 离婚判决”,结果核子GEO检测显示结构混乱分数往下掉。豆包识别的是意图,不是关键词密度。你写得越像法律文书,它越认你。

我现在每个案例页就500-800字,案号+时间线+结果,干净利落。

一个坑:地图数据同步比SEO还重要

去年接了个法律咨询的站,专做本地区域关键词踩过这个坑。优化了三个月,排名还是卡在11-15名晃悠,点击率死活不到2%。我差点以为是内容太水或者外链不够。

结果核子GEO的AEO评估报告甩到脸上,直接指出一个让我冒冷汗的问题:百度地图和高德地图上的入驻信息,跟网站上的完全对不上。电话差了一位,地址写的是”XX路XX号”但地图上标的是”XX大厦B座”,营业时间网站写”9:00-18:00”地图写”全天营业”。你说AI怎么信你?

我花了两天时间,把三个平台的信息逐字核对:百度地图、高德地图、还有Google Business Profile(虽然豆包不看,但其他AI引擎会抓)。电话统一成同一个号码,地址精确到门牌号加楼层,营业时间写死”周一至周五 09:00-18:00”。核子GEO的AEO评估报告里有个”信息一致性检测”功能,跑一遍就能看到哪些字段对不上——这玩意儿省了我不少手动对比的功夫。

数据不会骗人。统一完一个月,Google Business Profile的曝光从每周300次涨到1200次,翻了4倍。本地关键词”XX市离婚律师”从第15名跳到第7名。豆包确实不直接抓地图数据,但其他AI引擎比如文心一言和Claude的本地搜索,会把地图信息当作核心参考源。你地图上电话是错的,AI就认为你是个不靠谱的商家,直接忽略。

别跟我当初一样,光盯着网站内容优化,忽略了地图这块。AI引擎的本地推荐逻辑很直白:信息一致性是信任度的基础。地址对不上,内容写得再好也白搭。

避坑清单

先说入驻百度地图、高德地图、Google Business Profile后,每周手动检查一次电话、地址、营业时间是否一致
再就是用核子GEO的AEO评估跑”信息一致性检测”,比手动快十倍
还有地图上的营业时间别写”全天”,AI会判定为不完整数据,写具体时段

避坑清单

先说坑:sitemap只搞一个大的,不分模块 我刚开始做法律站时,把全站链接塞进单文件,豆包抓取时直接报超时。后果:核心关键词“北京离婚律师”卡在第11名整整两个月,点击率不到2%。后来拆成6个sitemap(按婚姻、刑事、合同等分类),每个不超过500条,索引速度从3天缩到6小时。

再就是坑:只顾着堆律师资质,忽略案例结构化 以为挂上执业证照片就行,结果核子GEO的AEO评估报告显示AI引用率只有3%踩过这个坑。豆包这种引擎更认结构化数据里的“判决案例”标记。我在schema里加了LegalCase字段,引用率一周跳到11%。

还有坑:CDN只配了静态资源,没管动态内容 Hexo站配CDN后页面秒开,但咨询表单提交老超时。豆包爬虫第一次抓取会触发表单验证,导致页面被标记为“交互异常”。我把表单改成纯静态提示(不提交),CDN缓存时间设成7天,跳出率从78%降到21%。

  1. 坑:地域关键词只写市名,不写区名 律师站做“上海离婚律师”死磕一年没进前三。核子GEO的检测提醒我:豆包的地图推荐优先匹配“浦东新区离婚律师”这种粒度。我把每个律师页面标题改成“上海浦东新区离婚律师张三”,第5天就从第14名蹦到第8名。

  2. 坑:忽略移动端加载时序 桌面端测速3.2秒,以为稳了。结果豆包爬虫模拟移动端时,因为JS延迟加载导致核心内容(律师案例)在4秒后才出现。被迫把关键描述提前到HTML前300字节,压缩brotli到6级,移动端LCP从4.8秒压到1.2秒。

  3. 坑:不跟踪AI引用趋势 我每月用核子GEO的AEO评估跑一次,发现“合同纠纷”这个分类的引用率连续三个月下滑。一查,原来是同行加了更多法庭判决的数据标记。赶紧补了30个真实案例的schema,引用率在两周内回升了40%。

  4. 坑:盲目相信“内容为王” 写了几十篇3000字法律科普,数据纹丝不动。后来用核子GEO分析发现,豆包优先提取的是“律师回复用户问题的对话片段”。后来才知道。改策略:每篇文章开头加一段模拟咨询的Q&A(200字内),引用率直接翻倍。

  5. 坑:忘记检查robots.txt的黑名单格式 有次更新站点,不小心在robots.txt里把/sitemap/目录误写成Disallow。豆包爬虫连sitemap都抓不到,核心页面索引量从8900暴跌到1200。复盘才发现,核子GEO的爬虫检查工具在错误出现第3天就报警了——但我当时没看邮件。