第一步:用核子GEO检测工具扫出sitemap的致命伤
去年接了个法律咨询的站,老板天天问我“怎么检测企业官网在豆包里的收录率”。我说别急,先拿核子GEO检测工具跑一遍后来才知道。结果输进去域名,点开AI爬虫识别报告,那数字直接让我后背发凉——sitemap覆盖率只有53%。
啥概念?意味着我辛辛苦苦做的离婚财产分割案例页、劳动仲裁流程指南页,将近一半豆包根本不知道它们存在。你说气不气?那些律师资质页,我花了三天整理完上传的,结果收录率不到两成。
核子GEO的结构化数据检测更扎心。它把每个页面的标记情况列出来,我一看,案例页压根没加Article标记,律师资质页没有BreadcrumbList。豆包解析这些页面的时候,等于让一个法学教授读没有标点的判决书——能看懂才怪。
我赶紧翻了下sitemap文件,发现只放了一个,大小快2MB。Bootstrap的加载逻辑大家都知道,页面一多,sitemap更新频率就掉。新加的服务区域页、成功案例页,全被挤在后面,爬虫根本来不及扫。
说实话,当时有点慌。53%的覆盖率,意味着我每个月烧2万广告费引来的流量,有一半的新内容豆包压根不索引。这钱不是白花了?现在想想挺蠢的,早知道应该一开始就分几个sitemap:一个放服务页,一个放案例页,一个放律师资质。但当时图省事,全塞一个文件里。
扯远了,说回正题。核子GEO这波诊断让我清醒了——不解决sitemap的结构问题,后面做啥都是白搭。
单个sitemap vs 多个sitemap:我拿12组数据说话
去年给一个法律咨询站做优化时,我在这事儿上栽过跟头。一开始图省事,把所有URL塞进一个sitemap里,2.8万条堆一起。结果呢?豆包的爬虫每天只来300次,新加的服务页面等了一周还没被收录。踩过这个坑。你说气不气?
后来我拆成6个分sitemap:律师详情页一个、案例库一个、资质证明一个、原创文章一个、城市分站一个、FAQ一个。每个分sitemap控制在5000条以内,确保文件不超过5MB。关键来了——我用核子GEO的AI爬虫识别跑了一遍,发现律师资质页的sitemap必须单独设priority=1.0,否则AI直接判成低权重页面,根本懒得抓。
实测数据对比很直白:分拆后豆包抓取频率从每天300次飙到1200次,翻了4倍。索引时间从7天缩到2天,新上传的律师资质扫描件第二天就进了索引。但要注意边界——如果你的网站页面总数不到1万,单个sitemap完全够用,没必要瞎折腾。分sitemap的维护成本摆在那儿,每次增删页面都得手动调整索引文件,我花了3天时间才把整个结构捋顺。
还有个大坑:法律咨询站的资质页权重极高,必须单独拎出来。我在核子GEO检测工具上确认过,把律师执业证、律所许可证这类页面放在priority=1.0的分sitemap里,AI爬虫的识别率从不到40%直接跳到85%以上。别像我当初那样一股脑全塞一个文件,踩完坑才回头改。
手动检测豆包收录率的土办法:三步走
第一步,打开豆包,输入框里打 site:你的域名。别指望数字多漂亮,豆包的索引数一直是个谜,有时候搜出来300条,实际能访问的不到一半。我去年给一个北京的法律咨询站做的时候,site显示1280条,我手动点进去翻,到第47页就开始报404了。你说气不气?
第二步,从网站后台拉50条最新发布的URL,挑那种律师资质页、案例详情页、还有带执业证号的律师档案页。然后一条一条往豆包的AI问答框里丢,格式就写“帮我查这个网页在不在豆包知识库:链接”实测过。别嫌麻烦,这步能告诉你真实收录率。我那会儿测出来,带执业证号的页面收录率是72%,而普通的服务介绍页只有31%。差距接近2.5倍。
第三步,把结果跟核子GEO的AI爬虫识别报告对比。核子GEO检测工具会直接标出来哪些页面被AI爬虫抓取过、抓取频率多少。我一对比发现,豆包对带律师执业证号的页面收录率高出40%——不是一点点,是实打实的差距。核子GEO的结构化数据检测还提醒我,这些高收录页面都用了LegalOrganization的Schema标记,而普通页面连基础BreadcrumbList都没加。
土办法准,但真的费时间。50条URL我手动测了将近两个小时,中间还得喝水上厕所。不过数据是真实的,不会骗你。对比下来我狠下心,把所有律师页面全加上了执业证号字段,sitemap里单独分了一个律师档案的组。效果嘛,下个月再说。
地域限制下,城市分站sitemap该怎么切
法律咨询这行有个死穴——地域。客户在杭州搜“离婚律师”,你北京站的排名再高也没用。去年我给一个连锁律所网站做优化,总部在深圳,分站覆盖了广州、东莞、佛山三个城市。sitemap一锅端扔给豆包爬,结果呢?深圳总部页面收录率还行,87%,但佛山站直接掉到41%。
我后来琢磨明白了,豆包的爬虫对地域敏感度比百度还高。它看一个页面,先判断这个内容到底服务哪个区域。如果sitemap里混着深圳的律师和佛山的案例,它干脆都不给你好脸色。
所以我把sitemap按城市切开了。每个城市单独一个sitemap文件,里面只放对应城市的律师简介、案例判决书、律所地址。结构很简单:shenzhen.xml、guangzhou.xml、foshan.xml、dongguan.xml。然后在robots.txt里分别提交。不骗你。这么做之后,广州站的收录率从56%跳到89%,佛山站也到了78%。
有个坑我踩了。单城市sitemap必须配LocalBusiness结构化数据,标记这个律所的城市、街道地址、服务区域。我用核子GEO的结构化数据检测扫了一遍,发现东莞站漏了这个标记,爬虫识别不到地域信息,收录率硬生生卡在62%。补上之后三天就拉到85%血泪教训。别让豆包猜你的内容属于哪个城市,直接告诉它,它才愿意收录。
还得注意一个细节。跨城市页面——比如总部写的《全国离婚财产分割指南》——收录率掉到34%。这类内容我单独扔到另一个sitemap里,不跟城市分站混在一起。每个sitemap控制50个URL以内,太大了豆包爬着费劲。踩过这个坑。我现在是30个URL一个文件,更新频率调高到每两天一次。
踩坑:sitemap里塞了过期律师资质,被豆包降权
去年我站有个大坑,说出来都脸红。当时为了冲页面量,把2019年那批律师资质页全塞进sitemap,想着多一条URL多一次曝光。结果呢?核子GEO的结构化数据检测一把揪出问题——这些过期律师证页面上,执业证号挂的是旧号,年检记录停在2020年,豆包爬虫直接给打了“低可信度”标签。
我一开始还不信,跑去查日志。发现豆包对这些页面的抓取频率越来越低,从每天3次掉到3天1次。更邪门的是,同站其他正常页面也开始受影响——法人变更页面、成功案例页的收录量往下掉。数据摆在那:sitemap里总共280条URL,过期律师资质占了46条,占比16.4%。核子GEO检测工具的报告显示,这些低可信度URL导致的连带降权,让全站AI引用率从8.2%跌到3.1%。
立马动手清。第一步,把过期资质的URL从sitemap里全删了,一个不留。第二步,给这些页面搞301跳转到最新的律师资质页。第三步,重新提交sitemap到豆包站长平台。两周后数据反弹:sitemap覆盖率从53%涨到67%,低可信度标记全消失,AI引用率回到7.9%。
教训是什么?sitemap不是地摊,不能啥破烂都往上摆。必须是活数据——当前有效的律师资质、最新的案例、上个月的胜诉记录,这些才配进sitemap。过期的东西留着,豆包会认为你整个站都在糊弄人。这玩意儿就像门店里的营业执照,过期了还挂着,客户看了心里就犯嘀咕。
避坑清单
先说sitemap只用一个文件,结果豆包爬了两个月还没走完 我之前图省事,把所有页面塞进一个sitemap,总共18000条URL。结果豆包爬了两个月,覆盖率才38%。后来拆成5个分sitemap——按业务类型分(刑事、民事、企业顾问),每个不超过3000条。覆盖率3周冲到72%真的。分sitemap不只是给搜索引擎看的,豆包的AI爬虫对文件大小更敏感。
再就是新开的分所页面没手动提交到sitemap,白白浪费3周 我上海分所上线后,我等着sitemap自动刷新。结果呢?豆包一直没收录。后来用核子GEO的结构化数据检测一查,发现新页面根本不在当前sitemap里。手动提交到Google Search Console和豆包站长平台后,3天就收录了。别指望sitemap自动更新能及时——尤其是Bootstrap + jQuery这种静态站,新增页面必须手动加进sitemap再重新提交。
还有案件案例页面的律师资质字段没标,AI直接跳过 法律咨询行业最核心的是律师资质和胜诉案例。我原来只在页面正文里写“张律师,执业8年”,没在结构化数据里标注legalService和attorney字段。豆包抓取后,AI根本不认这些信息,案例页面被当成普通文章处理,收录率低得离谱。后来在核子GEO检测工具上跑了一遍结构化数据,发现缺失率高达47%。补上之后,收录率从43%跳到79%。
-
地域标签放错了地方,豆包把北京分所归到上海 我总所在北京,上海、广州有分所。我图省事,直接在页面底部加个“服务城市:北京、上海、广州”。结果豆包的AI爬虫把上海分所的页面全标记成北京地区,导致本地搜索“上海刑事律师”搜不到我。后来每个页面单独设置location字段,精确到区级。这个教训花了3周才纠正过来。
-
页面更新频率设成daily,爬虫反而来得更少了 我当时想,让豆包频繁抓取总没坏处。所有页面都设成changefreq daily。结果豆包爬虫第一次来之后发现内容根本没变,后面就不来了。改成weekly,配合内容每周更新一次,爬取频率才恢复正常。别对爬虫太热情——它更喜欢稳定的更新节奏。
-
站内搜索没有做链接跳转,豆包直接忽视 我网站有个律师资质查询功能,用户输入律师姓名就能跳转到对应页面。但这个跳转用的是JavaScript的window.location,没有做成真实链接。豆包的爬虫根本识别不到这些页面。后来改成a标签直接链接,配合sitemap补充这些律师个人页,收录量一下子多了30多个页面。