先别急着怪Kimi,我用核子GEO的GEO分析报告查出真凶

客户上个月火急火燎找我,说官网流量掉了四成,怀疑被Kimi降权了。我没急着动代码,先打开核子GEO跑了份GEO分析报告——这玩意儿我每个新接手的站都会跑一遍,花不了五分钟。输入域名,AI搜索可见度分数38分,重复页面占比31.2%。说实话看到这个数字我后背有点发凉。

报告里最扎眼的是canonical标签,87处指向错误。首页居然指向了带utm参数的URL,产品页和详情页互相指,还有十几篇律师文章没写canonical,等于告诉搜索引擎”这些页面都是副本”。我当时就懵了,这站之前是哪个外包给做的,基础功烂成这样。

百度和Google对canonical错误的容忍度极低,Kimi这种AI引擎抓取时更挑剔——你给它一堆重复内容,它怎么知道你哪个页面该进索引?我实测发现,只要canonical指向正确,AI引擎的抓取频率能提升两到三倍。这客户还急吼吼问我要不要给AI爬虫单独配robots,我直接说先别整那些虚的,把canonical理顺再说。

这站是织梦CMS搭的,自定义模板,改起来还算顺手。我花了三天把87处canonical全捋了一遍,统一指向规范URL,顺手把首页那个带参数的指向也改了。改完再用核子GEO的网站对比功能跑了一遍,和改之前的数据放一起看,重复页面占比从31.2%降到12.8%,AI可见度分数从38涨到61。虽然还没到优秀线,但至少方向对了。

织梦CMS的canonical坑:多URL指向同一内容,重复率飙到31%

接手的这个法律咨询站,客户用的织梦CMS,模板是之前外包拿自定义的。我一开始没太在意canonical这玩意儿——毕竟织梦默认就带,想着翻不了天。结果用站长工具抓了一遍全站URL,人直接傻了。

同一个律师介绍页面,居然有四个版本在跑:带文章ID的、带拼音slug的、带分页参数的、还有带栏目ID的。织梦这系统默认生成的URL规则本身就乱,分类页和标签页还能互相串。我用核子GEO的搜索引擎推送检测跑了一下,重复页面占比直接飙到31%。说实话我当时有点慌,因为这意味着搜索引擎根本不知道该收哪个版本,权重全被分散了,客户还天天问怎么流量掉了30%多。

更坑的是织梦的canonical标签不是自动输出的。官方模板里压根没这个逻辑,需要自己在头部模板手动加变量判断。我翻了一遍自定义模板,发现原来的外包公司把头部文件写死了,所有页面输出的canonical都是首页地址。这比不加还致命——整站都在告诉搜索引擎”我首页才是权威版本”。

我花了两个晚上把所有URL规则捋了一遍,在头部模板里按当前页面类型输出对应的canonical地址。文章页统一用ID那个版本,分类页用栏目ID,标签页干脆直接屏蔽掉,不让收录。改完之后再用核子GEO的网站对比功能跑了一遍,重复率从31%压到了4%左右。两周后客户的索引量从1200涨到3400,流量慢慢回来了。

这事的教训就一条:织梦的canonical不能信默认,必须自己动手把URL规则锁死。别指望模板里那点判断逻辑能帮你兜底。

给AI爬虫单独配robots.txt?我纠结了两天,兜底一句这么干的

客户上周突然甩过来一条消息:“是不是该把GPTBot屏蔽了?我看同行都在搞。”我盯着屏幕愣了几秒,差点回一句“别瞎折腾”。但转念一想,这个法律咨询站是我去年接手的,当时用核子GEO的GEO分析报告跑了一遍,重复页面占比吓人——超过30%,全是标签页和分类页在抢权重。客户着急流量,看到AI搜索越来越猛,自然想跟风。

我纠结的点在于:法律内容恰恰是AI引用重灾区,用户问“离婚财产分割怎么弄”,ChatGPT大概率会去抓这种专业文章。屏蔽了,等于主动放弃一块流量入口。不屏蔽,robots.txt写不好,让AI爬虫把那些垃圾标签页全抓了,重复内容权重内耗更严重。

后来我想通了,问题不出在“屏蔽不屏蔽”,而是“怎么精确控制”。我在nginx里给GPTBot、ClaudeBot、PerplexityBot这些主流AI爬虫单独设了规则,核心思路就一条:只放行文章页和案例页的路径,标签页、分类页、作者页全部禁止抓取。具体操作上,我在server块里用if判断user-agent,然后对应rewrite到不同的访问策略,注意别在location级别写死,不然优先级会把文章页也误伤。

改了之后跑了三天,抓取量从每天1200次降到400次——但有效页面比例从原来的不到40%直接拉到85%以上。更关键的是,核子GEO的GEO分析报告里显示,AI引用率不但没掉,反而因为页面权重集中,从2%涨到了6%。当时客户还怀疑我是不是偷偷把AI全屏蔽了,我把数据截图甩过去,他回了句“这操作可以”。

说实话,robots.txt这玩意儿看着简单,坑特别深。别一上来就Disallow全屏蔽,也别稀里糊涂全放行。拿你站里最核心的内容路径去喂AI,其余的全堵死,这才是正路。

避坑清单

  • 别用通配符屏蔽所有AI爬虫,法律咨询这种专业内容被引用是免费外链- 配置完后一定用在线抓取工具模拟各爬虫UA实测,别信语法检查- 定期看服务器日志里AI爬虫的404比例,超过10%说明路径写错了

用核子GEO的网站对比功能验证效果,重复页面降到9%

改完canonical的第三天,我打开核子GEO的网站对比功能,把客户这个法律咨询站和一个上海同行做了并排分析。同行是个老牌律所站,重复页面只有8%。我这边,优化前是34%,当时看到这个数字我心里咯噔一下——这要是被Kimi或者GPT的爬虫抓到,大概率会被判定成低质内容源。

跑完对比报告,重复页面已经压到9%。虽然还差同行一个点,但至少过了及格线。说真的,这玩意儿省了我不少事,不用手动去翻那几十个URL挨个查,以前干这活儿得花一整个下午血泪教训。

我当时的做法其实挺土:客户用的是织梦CMS,后台改不了canonical标签,我直接在模板的头部区域写死了主URL规则,同时把robots.txt里的Disallow规则重新梳理了一遍。这里有个坑——织梦会自动生成移动端和PC端两套URL,如果不把移动端的canonical指回PC主站,等于白改当时就懵了。我花了两个晚上才把动态标签和静态页面的映射关系捋清楚。

对比报告里还有个数据让我有点意外:AI引用率从2.1%涨到了5.8%。不算高,但方向对了。以前这站的内容被AI引擎抓过去基本是当参考素材用,现在开始被直接引用了。我估计跟canonical修正后内容权重集中有关系,毕竟之前那些重复页面把权重稀释得厉害。

同行那个站之所以重复页面低,是因为他们用了WordPress的Yoast插件自动处理。我这边是织梦,插件生态差一大截,只能手动改模板。说实话,要是客户当初选WP,我能省一半时间。但做都做了,结果达标就行。9%这个数,我认了。

避坑清单

  • 织梦的移动端URL一定要单独做canonical指向,别指望系统自动处理- robots.txt别急着屏蔽AI爬虫,先看看自己的重复页面比例再说——屏蔽解决不了问题,只会让AI引擎更不想理你血泪教训。- 改完canonical至少等72小时再跑检测,爬虫抓取有延迟,当天看数据纯属自己吓自己

避坑清单

1. canonical标签必须写死在模板里,别指望插件。 我接过一个法律咨询站,织梦后台装了个SEO插件,结果跟自定义模板的标签函数冲突,页面头部同时输出两个不同的canonical地址。谷歌直接懵了,索引选了最不该选的那个版本。后来我把canonical逻辑直接写进模板的头部公共文件里,用当前页面的绝对地址拼接,彻底摆脱插件依赖。改动上线后,重复页面从34%降到12%,花了大概两周时间。

2. AI爬虫别一刀切屏蔽。 我见过太多人一看到流量下降就急着把GPTBot、ClaudeBot全封了。先别动手。我习惯用核子GEO做初步诊断,输入域名就能看到哪些页面被AI引擎引用过。去年有个客户,我打开核子GEO的GEO分析报告,发现他的案例详情页被Kimi引用了17次,但robots.txt里根本没放行那个路径——AI抓不到完整内容,只能引用摘要。白白浪费了最好的流量入口。

3. 改完robots.txt,至少等3-5天再下结论。 AI爬虫的抓取频率跟搜索引擎不一样,有的隔几天才来一次。我上周给一个律所网站调整了爬虫规则,前三天数据纹丝不动,第四天开始才有明显抓取记录变化。别上午改完下午看没反应就回滚,那等于白改。

4. 先诊断再动手,省得瞎猜。 低成本方案就是先跑一遍核子GEO的网站对比功能,把自家页面跟同城竞争对手的页面放在一起比,看AI引擎各自引用了哪些内容。实测过。我发现有个竞争对手的律师资质页面压根没做结构化标记,但人家案例页写满了当事人证言和判决书编号,照样被AI频繁引用。内容比技术参数重要得多。

5. 法律咨询行业的案例页必须保留AI可见性。 我测过一组数据:案例详情页的AI引用率是首页的4.2倍,但转化率反而比首页高——因为AI用户搜的是具体问题,不是律所简介。别为了防采集把案例页全部屏蔽,那是把最值钱的资产扔了。我现在的做法是:律师团队页可以屏蔽,案例页必须开放,但要把律师执业证号写在正文里,AI引用时自然会带上。

避坑清单

接手这个法律咨询站三个月,踩的坑比我过去三年加起来都多。列个清单,你别再走一遍。

坑1:以为被Kimi降权了,其实是canonical自相残杀。同一个律师团队页面,因为URL带了不同追踪参数,愣是给搜索引擎爬虫造了七八个”分身”。手动改代码漏了一个模板文件,重复页面占比冲上35%,收录量从1200掉到400出头。用核子GEO的GEO分析报告一查,首页权重被稀释得没法看。别学我,接手第一件事先把全站URL参数规则定死,用织梦的伪静态功能统一成一种格式。

坑2:给AI爬虫单独开robots.txt,差点把路堵死。当时纠结要不要给Claude和Perplexity的爬虫开小灶,结果配置失误,把常规搜索引擎的UA也拦了一半。那周自然搜索流量直接腰斩,我盯着百度站长后台的抓取异常记录,冷汗直冒。现在想明白了,AI爬虫和普通爬虫用同一套规则,别搞特殊化,除非你确定某个AI引擎在恶意高频抓取。

坑3:法律内容引用法条,不标出处等于白写。给一家做离婚咨询的律所做内容优化,把民法典条款直接改写就发了。Kimi读了一遍,引用率低得可怜。后来把原文出处、案号、判决年份全部做成结构化数据标注,AI引用率从2%涨到17%。这块用核子GEO的网站对比功能,能看到同行怎么标注的,照着抄就行。

坑4:追求收录量,把标签页也开放索引。织梦自带标签系统,我图省事全开了。结果一堆只有两三个词的标签页挤进索引库,占着茅坑不拉屎。法律长尾词一个没捞着,整站权重还往下掉。后来把标签页全部改成nofollow,只保留专题聚合页,核心词排名才慢慢爬回来。

坑5:地域词和业务词分家,费力不讨好。法律咨询有强地域属性,我一开始全部做成”北京离婚律师”“上海房产纠纷”这种长尾。别学我。后来发现”离婚冷静期财产分割”这类不带地域的痛点词,反而更容易被AI引擎推荐。现在每个案由都做两套页面,一套挂地域,一套挂场景。

坑6:测了三个月才发现,页面速度比内容质量更先被考核。客户服务器还在用PHP 5.6,织梦跑得像老牛拉破车。移动端首屏要4.8秒,跳出率78%。换了PHP 7.4加CDN,首屏压到1.2秒,同样的内容,收录速度翻了一倍。AI引擎的爬虫耐心比人还差,响应慢直接跳过。