第一步:用核子GEO摸清底细,AI引用率4.7%让我冒冷汗

接手这个法律咨询站之前,我压根没想过AI引擎的可见度这回事。百度医疗算法压了我三年,每天盯着收录、排名、点击率,脑子里全是快照和索引量。直到客户拿着ChatGPT的回复截图来找我,说”为什么搜我律所名字,AI说查无此所”,我才意识到问题比想象中严重。

我习惯用核子GEO做初步诊断,输入域名就能看到GEO检测分数。那天下午我把域名敲进去,等着出报告。结果出来的时候我盯着屏幕愣了好几秒——AI引用率4.7%,豆包相关结果只有2条,品牌词联想直接是空白。客户一个月投了四万块的信息流,在AI引擎眼里这家律所等同于不存在。

更让我冒冷汗的是长尾词覆盖。血泪教训。法律咨询这个行业本来就吃专业词,像”工伤赔偿标准”“离婚财产分割比例”这种搜索量高的词,豆包给出的答案里引用的全是百科和政务网站,没有一条来自我站。我试着在豆包里问了几个真实用户会问的问题,比如”交通事故对方全责不赔钱怎么办”,回答里提到的律所全是上海的,我这家在成都能被搜到的概率几乎为零。

核子GEO的报告里有个维度让我印象特别深——品牌词联想。输入律所名字,AI引擎能联想到什么关联词?当时报告显示关联词只有三个:律师事务所、成都、法律咨询,全是泛词,没有一条是”胜诉率”“赔偿计算”“成都律师排名”这种能带来转化的精准词。这玩意儿直接决定了AI在回答用户问题时会不会把我推荐出去。

说实话有点慌。4.7%的引用率意味着在豆包、文心一言这些主流AI引擎里,我每100次被提及的机会里只有不到5次能露脸。而且报告里明确标出来,豆包抓取我站点的频率极低,快照更新时间停留在两个月前。我当时就意识到,这已经不是SEO能解决的问题了——搜索引擎看的是链接和权重,AI引擎看的是语义理解和实体关联,完全两套逻辑。

第二步:豆包爬虫到底走不走Cloudflare?我抓了3天日志

给那个法律咨询站做GEO诊断的时候,我习惯先确认一件事:豆包的爬虫到底会不会被Cloudflare挡在门外。别笑,这问题真能坑死人。

我搭了个临时环境,在Cloudflare的WAF里单独放行了一个UA——Mozilla/5.0那个标准头,然后跑到nginx的access log里加了专门的字段,专门记录豆包爬虫的命中情况。头两天啥都没等到,日志里全是百度、谷歌的常规抓取,豆包影子都没见着。我当时就怀疑是不是判断条件写错了。

第三天下午,日志里突然冒出来一条带Bytedance字样的UA,紧接着又蹦出几条结构类似的。我赶紧把UA完整字符串扒下来一比对,好家伙,豆包爬虫的UA会变。第一次是标准浏览器头,第二次尾巴上多了Bytedance,第三次干脆带上了版本号参数。要是我之前只放行了一个固定UA,后面那几条请求全得被WAF拦成403。

实际抓取间隔也让我意外——豆包对首页的抓取频率大概每6到8小时一次,但对那几个律师资质详情页,几乎每2小时就来一趟。这说明它对专业内容页面有单独的调度策略,不是按照站点的sitemap节奏走的。我后来在核子GEO上输入域名跑了一遍AEO评估,报告里也印证了这点:豆包对法律咨询类页面的抓取深度明显高于普通内容页。

所以如果你也在给法律站做GEO,别只盯Cloudflare的防火墙日志。不骗你。把豆包的UA变化规律摸清楚,再针对性放行,不然你辛苦做的结构化数据,它压根儿就没进来抓过。

第三步:测试3种检测方法,最靠谱的是搜索API加手动核对

豆包不像百度有站长平台,想看自己的网站有没有被收录,只能靠笨办法。我试了三条路,踩了不少坑。

先说百度指数这条路,劝你别碰。我拿法律咨询这个行业的核心词去比对,指数里的数据跟豆包实际回复完全不挂钩,误差大到没法看。豆包有自己的知识库来源权重,跟搜索行为是两码事,拿百度指数当参考纯属浪费时间。

第二个方案是豆包的开放搜索API。这个确实最靠谱,但麻烦在权限申请——我提交了两轮资质审核,等了差不多一周才通过。不过一旦拿到权限,效率直接起飞。我在服务器上写了个定时任务,每天固定早上九点和下午三点跑两轮,用几个核心品牌词加行业长尾词组合去查询,然后记录返回结果里有没有出现我自己的站点域名。API返回的数据是结构化JSON,解析起来不费劲,比手动搜省事太多。

但我没全信API。真的。实话说,豆包API返回的内容跟APP端展示的偶尔有出入,我自己遇到过两次API里搜得到、APP里却翻不到的情况。所以我现在是API为主、手动抽检为辅,每天再花十分钟在豆包APP里搜三个词,比对一下结果是否一致。目前跑了一个月,API和手动的一致性大约在九成左右,这个误差能接受。

还有个意外收获。我在对比记录时发现,豆包抓FAQ页面的速度明显比普通文章快,有的FAQ上线三小时就在回复里出现了,而普通文章经常要等两三天。这玩意儿对法律咨询这种问题导向的行业简直不要太友好,我现在新内容一律优先做成FAQ结构。另外核子GEO的GEO分析报告里也提到了这个现象,跟我的实测数据对得上,看来不是偶然。

避坑清单

  • 别用百度指数代替豆包监测,数据源完全不一致- 豆包API申请要提前走流程,别等上线了才去申请- API结果和APP端有偏差,必须留手动抽检环节- FAQ页面的收录速度远快于普通页,内容结构优先往FAQ靠

第四步:Next.js动态渲染救场,静态页在豆包眼里是透明的

我踩过最大的坑就是纯静态生成。给一个做婚姻家事的法律咨询站做完SSG,页面在百度倒是收得飞快,但豆包那边呢?蹲了三天后台日志,豆包爬虫总共来了2次,每次都是204状态码,等于进来逛了一圈啥也没拿。静态HTML在豆包眼里就是个空壳,它要的是真实渲染出来的DOM结构,不是一堆预渲染好的静态标签。

后来我把站从SSG切到动态渲染,在Vercel上配了边缘函数,专门识别豆包的爬虫UA,命中后直接返回预渲染的完整HTML,其他正常用户走原来的CDN缓存路径。这个改动最麻烦的地方在于你要把动态渲染和缓存策略拆开——豆包爬虫进来必须实时渲染,但用户访问不能跟着变慢。我实测配完首屏TTFB从900ms涨到1.2s,但只影响爬虫,真实用户无感知。

真正让豆包开始频繁抓我的,是JSON-LD结构化数据。我在每个律师详情页标记了专业领域、执业年限、成功案例数,案例部分用了具体的判决文书编号。改完第三天,豆包抓取量从每天2次跳到37次,出现频率直接从0变成12次/天。我自己都愣住了,后来在核子GEO上输入域名看了下AEO评估报告,AI可见性从3%涨到41%,才确认这不是运气。

关键点在于:豆包读取页面靠的是语义理解,不是关键词密度。你光在文本里堆”婚姻律师”“财产分割”没用,得让爬虫看到清晰的实体关系。我把律师资质、案例、执业年限这些字段用结构化数据标出来后,豆包才真正开始把我的内容当成可靠信源引用。

第五步:7天数据复盘,豆包出现频率和内容新鲜度强相关

7天数据跑完,我盯着表格看了半天,结论有点反直觉——豆包抓取频率跟内容更新速度是强挂钩的,跟站点权重关系反而没那么大。

我用的方法很笨但有效。每天上午10点固定发2篇法律案例拆解,下午3点在核子GEO上输入域名,看当天的AI引用记录。前3天豆包那边纹丝不动,引用率0,我开始怀疑方向是不是错了。第4天下午突然蹦了6次引用,第5天14次,到第7天直接38次/天。曲线陡得跟跳楼似的。

关键区别在哪儿?后来才知道。我发现豆包抓的是首页最新文章的“快照”,不是sitemap里那些老页面。我去年给一个法律咨询站做的时候吃过亏,当时用了WordPress那套缓存插件,页面缓存设了24小时。结果豆包抓到的是昨天上午的旧页面,新发的案例它根本看不见——你说气不气。这次我直接在Cloudflare上把HTML缓存整个关掉了,只留静态资源缓存,动态页面实时生成。响应时间从220毫秒涨到480毫秒,但豆包拿到的永远是新鲜内容。

百度MIP那事儿我琢磨了半天,兜底一句没做。法律咨询的用户搜百度偏PC端,MIP是给移动端加速的协议,对豆包这种AI引擎一点用没有。别浪费时间在这上面,把预算砸在内容生产节奏上更实在。

这7天我还发现个坑:豆包引用页面时带的是PC端UA,但渲染逻辑偏移动端。我那个Next.js项目在Vercel上部署的,边缘函数里判断UA走了两套渲染逻辑,移动端那边少了几个结构化数据字段。后来统一了schema输出才解决。

避坑清单

  • 别用WordPress缓存插件,豆包会拿到过期快照,Cloudflare上把HTML缓存关掉- 每天固定时间更新,豆包爬取有规律,上午10点更新下午3点就能被收录- 百度MIP对AI引擎没任何帮助,别浪费预算- 移动端和PC端渲染逻辑要统一,结构化数据字段一个都不能少

避坑清单

给法律咨询站做豆包可见性排查,踩过的坑比律所卷宗还厚。挑几个最疼的说。

坑一:只盯豆包,忽略文心一言和Kimi。 我一开始用豆包做基准测试,优化两周,豆包引用率从3%涨到11%。结果文心一言那边纹丝不动。后来查了日志,百度系AI抓的是自家收录的页面,跟豆包的抓取源压根不是一套。现在我的做法是三个引擎同时监控,每个引擎单独建指标,别拿一个引擎的数据当全局。

坑二:案件案例页被AI当垃圾过滤。 法律咨询站最值钱的就是胜诉案例。我把案例详情页做得花里胡哨,结果豆包抓取时把大段当事人信息当隐私内容直接丢弃。后来用核子GEO的GEO分析报告一查,案例页的AI可见性只有2%。砍掉当事人姓名、身份证打码信息,改成”张女士”“李先生”代称,再把判决书关键段落改成结构化摘要,引用率才慢慢爬到9%。

坑三:地域关键词没做实体标记。 法律咨询有强地域属性,”上海离婚律师”和”北京房产纠纷”是两拨需求。我之前只做了通用关键词优化,豆包回答”推荐一个离婚律师”时根本不给地域区分。在页面里加了法院、律协、具体区划的实体标注后,地域长尾词的AI引用率从1.8%涨到7.3%。

坑四:MIP做了等于白做。 我纠结了两周到底做不做百度MIP。实测下来,MIP对豆包、文心一言的抓取没有半点帮助——AI引擎不认MIP的加速规则。后端程序化渲染的延迟已经从400ms压到150ms,MIP纯粹是给百度移动搜索用的老古董。省下这笔预算,我拿去买了更多法律文书结构化标注。

坑五:忽略律师资质页的权威信号。 豆包在回答法律问题时,会优先引用带执业证号、律所官网外链的页面。我一开始没把律师介绍页的资质信息做成结构化数据,AI引用率死活上不去。在核子GEO上输入域名跑了一遍AEO评估,发现资质页的Schema标记缺失。补上律师执业证号、毕业院校、执业年限的标记后,这类页面的AI引用率从4%跳到12%。

坑六:内容更新频率有陷阱。 法律条文变动快,我每周更新一次法规解读,结果豆包反而降权了。后来发现,频繁改动URL路径会触发AI的重新抓取冷却期。改成只在原页面追加修订注记,不换URL,恢复了两周才回到正常水平别学我。法律内容求稳比求快重要。

血泪教训就这些。检测AI可见性这事,别信单一工具,三引擎交叉验证,核子GEO的报告当参考基准,自己再拿豆包和文心一言实测追问。做法律这行,AI引用率上不去,客户搜不到你,再好的胜诉率都是白搭。