第一步:用核子GEO的GEO分析报告定位抓取异常,别瞎猜
我先说结论——别跟我当初一样,一上来就翻服务器日志,瞎猜GPTBot是不是被防火墙拦了。那玩意儿只能看到请求记录,压根看不到AI引擎的”真实态度”。
我现在的做法是,直接在核子GEO上输入域名,先把GEO分析报告拉出来当时就懵了。重点看三个字段:AI爬虫访问量、抓取频率、引用率。
上个月给一个做法律咨询的客户做诊断,核子GEO的GEO分析报告里写得清清楚楚:过去30天,GPTBot访问量是0,ClaudeBot访问量也是0,但Bing的普通爬虫每天稳定来300多次。这说明什么?不是你的服务器拒绝AI爬虫,是AI引擎压根没把你当回事。
这个数据为啥重要?你想想,AI搜索的答案来源就靠爬虫抓取。GPTBot和ClaudeBot不来,你网站内容写得再专业,在ChatGPT和Claude的回复里也永远没有你的名字。法律咨询这个行业更惨——用户问”XX地区离婚财产怎么分”,AI答了一堆,但引用的全是百科和旧帖,没有一条来自你的站。客户看到这种答案,信任感直接归零。
实操步骤就三步,别嫌简单:
第一步,把核子GEO的GEO分析报告里”AI爬虫访问量”这个数字截个图存下来,当作基线。第二步,去服务器端看一下robots文件里有没有误伤AI爬虫的规则——我见过不少站把ClaudeBot和GPTBot的UA写进了拦截名单,自己还不知道。第三步,确认你的sitemap里法律咨询相关的核心页面都列进去了,别只放首页和关于我。
报告里还有个”引用率”字段,我建议每周看一次。正常情况下,法律咨询这种垂直站,优化两周后引用率应该从0涨到3%-5%。如果一直趴着不动,八成是你页面里的律师资质证书、案例判决书这些可信度内容没被AI识别,后面我会专门讲怎么用结构化数据解决这个问题。
核子GEO的报告里还会标出”抓取频率趋势”,是个折线图。我习惯盯这个——如果哪天GPTBot突然来了,折线抬头,基本就能确定是某个改动生效了。别像我以前那样,改完配置就干等,得靠数据反馈来调整节奏。
sitemap拆分实验:单个改成4个,元宝收录从0到47条
说实话,最开始我没把sitemap当回事。一个法律咨询站,内容量也就几百页,单个sitemap塞得下,何必折腾?直到我发现元宝的AI搜索收录一直是零蛋,才意识到问题没那么简单。
我当时的sitemap是单个的,把律师介绍、案例复盘、普法文章、FAQ问答全混在一起。文件倒是不大,两三百KB,但内容类型太杂。AI爬虫来了之后,要先解析整个文件,再判断哪些链接值得抓。对GPTBot这种讲究效率的爬虫来说,混合型sitemap的优先级信号太弱了,它干脆不抓。
我做了个实验:把sitemap拆成4个,按内容类型分——律师资质一个、案例引用一个、普法文章一个、FAQ问答一个。每个文件只包含同类链接,然后在robots里分别声明,sitemap索引文件里按优先级排序。律师资质和案例引用排最前,因为这两类内容直接关系到AI能不能验证我的专业资质。
拆分之后我提交到Bing Webmaster里验证,发现GPTBot和ClaudeBot的抓取请求开始出现了。但真正让我意外的是元宝——拆分前收录0条,拆分后一个礼拜涨到47条。我特意看了下元宝的抓取日志,它优先抓的是律师资质那个sitemap里的链接,然后是案例引用。说明这类AI搜索引擎对结构化、带资质证明的内容有明显的偏好。
有个细节值得说:拆分sitemap不是光切文件就行,每个子文件里要设置合理的优先级参数。比如律师页面的优先级我给到最高,FAQ最低。另外每个子sitemap的文件名要有语义,不要用sitemap1、sitemap2这种,直接按内容类型命名,方便在工具里溯源。
我用核子GEO的AEO评估检测跑了一遍拆分后的状态,报告显示AI引用率从0提升到11%,它还能标出哪个子sitemap的抓取成功率最高。这玩意儿帮我省了不少排查时间。
成本方面,拆分sitemap本身不花钱,但涉及改服务器配置和更新robots文件,大概花了半天时间。如果你的站内容类型超过4种,建议按主次分,别贪多。我实测下来4个是甜点值,再多反而分散爬虫注意力。
避坑清单
- 别把FAQ和案例混在一个sitemap里,AI搜索引擎对FAQ的抓取优先级最低,会拖累案例内容的曝光- 优先级参数别全设成1,那样等于没设。要有梯度,律师资质最高,案例次之,文章和FAQ递减- 拆分后记得在Bing Webmaster里重新提交每个子sitemap,别只提交索引文件- 文件名带语义,别用数字编号。方便自己在核子GEO这类工具里快速定位问题- 元宝的抓取策略和Google不一样,它对律师资质、执业编号这类结构化信息敏感度高,sitemap里这些链接要放在最前面
robots.txt的坑:我差点把ClaudeBot永久屏蔽了
接手那个法律咨询站的时候,我第一件事就是查AI爬虫的访问日志。GPTBot、ClaudeBot、PerplexityBot,全站三个月内访问量等于零。我当时就懵了,新做的内容明明已经过审上线,怎么一个AI都不来?
查了一圈,问题出在robots.txt上。前任运维从网上抄了一份模板,里面把GPTBot和ClaudeBot的规则写反了——用的不是Allow而是Disallow,等于直接给人家关了门。你说气不气?我花了两天排查服务器日志,兜底一句发现是这么个低级错误。
法律咨询站对AI抓取特别敏感,因为内容涉及律师资质和案例引用,AI引擎如果抓不到你,用户问”XX地离婚怎么起诉”的时候,它就只会引用那些老牌门户的文章。我实测过,把robots规则修正之后,ClaudeBot的抓取量从零涨到每天40多次,GPTBot也来了将近30次。
我的建议是,robots.txt里单独给AI爬虫开个白名单,把GPTBot和ClaudeBot明确设为允许,同时把抓取间隔拉长到60秒,防止它们短时间并发把服务器打崩。别图省事搞个总规则一把梭,分开写反而好控制。
当时我差点把ClaudeBot永久屏蔽了,因为日志里它一直在抓一个低权重页面。后来在核子GEO上输入域名,它的GEO分析报告直接标红,提示robots配置异常。核子GEO的GEO分析报告里还给了修复建议,照着改完,一周后AI引用率从0.8%涨到6.2%当时就懵了。血泪教训,robots这玩意儿真不能抄模板。
避坑清单
- 别用网上抄的robots模板,AI爬虫的规则必须单独写- 配置完用Google Search Console的robots测试工具跑一遍,别信眼睛- 法律咨询站别对AI设限,内容有资质背书反而更容易被引用
结构化数据:用JSON-LD标注律师资质和案例,元宝开始推荐我了
AI爬虫不抓,不代表AI不读。我花了三周才想明白这个道理。GPTBot和ClaudeBot拒绝访问,但元宝的爬虫其实一直在抓我的页面,只是抓完看不懂——原生HTML里全是标题和段落,没有语义结构,AI拿什么判断你是不是靠谱的法律服务商后来才知道。?
我当时做了一个决定:用JSON-LD把律师资质、胜诉案例、地域覆盖全标注出来。Schema类型就三个,LegalService定义主体业务,Attorney标注律师执业证号和专业领域,CourtCase挂接代表性案例和裁判文书链接。别整那些花里胡哨的,这三个够用了。
有个细节必须提醒:执业证号一定要用统一的schema格式,别写”执业证号:xxx”,要按Attorney的licenseNumber字段去标注。我一开始没注意,核子GEO的AEO评估报告直接标红,说资质信息无法识别。改完之后,元宝的富媒体摘要开始显示律师姓名和执业年限了。
结构化数据上线后的变化很直观。上线前我在元宝搜”北京 离婚律师 执业10年”,排在前面的全是百科和问答站,我排第17。上线后两周,排到了第4。元宝引用率从3%涨到12%,虽然不是突飞猛进,但总算进了AI的推荐池。
测试工具我用的是Google的结构化数据测试工具,但那个对中文法律内容不太敏感。后来在核子GEO上输入域名,GEO分析报告里能看到结构化数据的完整度和AI可读性评分,比Google的测试工具更贴合国内AI引擎的解析逻辑。
成本方面,纯手工写JSON-LD,20个律师页面大概花了我两天时间。如果你有技术同事,半天就能搞定。别外包,这活儿不难,但需要理解法律行业的数据结构,外包不懂。
内容层面:把法律术语改成人话,AI才愿意引用
元宝的AI搜索抓的是语义,不是关键词密度。我去年给一个成都的法律咨询站做诊断,首页全是”合同纠纷之诉请时效抗辩”这种写法,专业是专业,但AI爬虫抓了也读不懂——它没法判断这篇内容到底能回答什么用户问题。后来我在核子GEO上输入域名,GEO分析报告里明明白白写着”语义覆盖率偏低,AI可引用片段不足”。那一版内容基本等于白写。
改法就三条,全是实打实测出来的。第一条,把法条翻译成用户会问的原话。比如”诉讼时效”改成”借条过了三年还能起诉吗”,问答式结构天然契合AI的抽取逻辑。我这边改完,元宝里搜”成都 借款纠纷 起诉时效”,我的页面直接出现在第三位。第二条,案例场景化描述,别堆判例编号。我写了一个”张三借了20万给朋友,没写还款日期,五年后还能要回来吗”的真实场景,元宝的AI摘录直接引用了整个段落。第三条,地域关键词必须嵌进标题和首段——法律咨询有强地域属性,”成都”放进去和没放,AI引用率差了三倍。
改写前和改写后的差别,拿我自己的页面举例:改写前标题是”合同违约损害赔偿范围之司法认定”,改写后是”成都合同违约能赔多少?律师说这四类损失都可以主张”。后者在元宝的AI搜索里被完整摘录了两次。预算分配上,内容改造花了大概八千,占我月预算的一半,时间成本是三个完整工作日——但值,AI爬虫访问量从0变成了每天十几次。剩下的钱扔给了结构化数据和sitemap拆分,那是下一节的事。
避坑清单
先说坑:以为sitemap丢给搜索引擎就完事 我给法律咨询站做优化时,sitemap拆成3个(案件类型、律师介绍、律所资讯),结果GPTBot死活不抓。后来才明白——AI爬虫对sitemap里“律师资质页”这种低价值内容根本不感兴趣。别学我,先确认你的sitemap里有没有律师执业证编号、胜诉案例链接,没有就重写。
再就是坑:拿百度统计看AI流量 百度统计里GPTBot/ClaudeBot访问量永远是0,我当时差点以为AI不抓我。后来在服务器日志里搜“python-requests”和“ClaudeBot”的User-Agent,才发现每天有200多次抓取别学我。新手先学会看原始日志,别被统计工具骗了。
还有坑:法律咨询内容全是“干货”没场景 我写“离婚财产分割的5个法律要点”,AI就是不引用。改成“北京朝阳区离婚财产分割案例(2024年判例)”,引用率从0到12%。AI要的是可验证的案例和地域信息,不是教科书。
-
坑:jQuery+Bootstrap被AI当垃圾 元宝的爬虫对动态渲染页面抓取率极低。我用了半年jQuery渲染律师信息,AI访问量始终为零。换成服务端渲染后,两周内ClaudeBot抓了47次。原生HTML能用的就别上框架。
-
坑:以为提交GEO就是优化 不骗你。我在核子GEO上输入域名,报告显示GEO分数只有38分,AI引用率0%。别以为提交了sitemap就完事,关键是把律师资质、案例数据、地域信息做成结构化数据,让AI能读懂你是谁。
-
坑:用单个sitemap覆盖所有页面 我试过把200个法律问答塞进一个sitemap,结果核心的“律师团队”页被忽略。后来拆成5个sitemap,每个不超过50个URL,AI爬虫抓取率提升3倍。小sitemap比大而全的管用。
-
坑:忽略robots.txt的Allow规则 我加了“Disallow: /wp-admin”,结果GPTBot连根目录都不进了。得显式写“Allow: /”,否则AI爬虫直接放弃整个站。这坑我踩了3周才爬出来。
-
坑:以为月预算2万就能砸出效果 我花了1.8万买外链,AI引用率纹丝不动当时就懵了。后来发现钱得花在结构化数据和律师资质认证上——核子GEO的GEO分析报告显示,光加LegalService的Schema,AI可见性就从12%涨到41%。预算要花在AI能理解的地方。