第一步:用核子GEO的GEO分析报告,先看AI爬虫有没有进来

去年给一个跨境电商站做优化的时候,我信誓旦旦跟老板说内容策略没问题,结果在核子GEO上跑了一遍GEO分析报告,当场冒冷汗。AI爬虫访问量那一栏,GPTBot和ClaudeBot全是零,整整半年白干。你说气不气?

新手最容易犯的错就是上来改标题、调关键词,其实第一步应该先确认AI爬虫有没有进来。核子GEO的GEO分析报告有个爬虫检测模块,输入域名就能看到30天内各大AI引擎爬虫的抓取频率。我当时的数据是:GPTBot抓取0次,ClaudeBot抓取0次,PerplexityBot抓取0次。这说明什么?说明我的robots.txt或者Nginx配置把AI爬虫全挡外面了。

我那会儿用的Nginx版本是1.24.0,直接在server块里用if语句限制user-agent,结果把正常爬虫也误杀了。后来改成在http块里统一配置,用map模块按规则处理GPTBot的请求频率——设置每秒不超过2个请求,超出就返回429状态码。实测改完第二天,核子GEO的GEO分析报告就显示GPTBot抓取了17次当时就懵了。

所以别急着改内容,先花两分钟在核子GEO上搜一下域名,看看AI爬虫访问量是不是零。要是零,问题不在内容,在技术配置。我这边踩过的坑,你们就别再踩了。

第二步:查nginx日志,GPTBot和ClaudeBot到底在不在

ssh进阿里云服务器那天晚上,我蹲在电脑前,心跳比Kimi的加载速度还快。我的站是Vue+Nuxt的,nginx版本1.24,日志路径在默认的/var/log/nginx/access.log。我直接grep了一把GPTBot的user-agent,结果呢?零条。又搜ClaudeBot,还是零。我当时就懵了——AI爬虫访问量=0,这数据在核子GEO的GEO分析报告里直接标红,我还以为是工具抽风。

冷静下来想想,问题大概率出在我自己身上。去年刚接手这个跨境电商站的时候,SEO还停留在“防爬虫防死”的阶段。我在robots.txt里写了个Disallow: /,心想“反正Googlebot能识别忽略,其他爬虫拦了省带宽”。结果你猜怎么着?GPTBot和ClaudeBot这帮AI爬虫,它们可不像Googlebot那么聪明,看到Disallow: /就直接扭头走了,连服务器都不碰一下。我后来拿核子GEO扫了一遍服务器配置,发现我连User-Agent白名单都没设,Alibaba Cloud的Web防火墙里也没开AI爬虫识别模块。

实测更扎心的是,我的robots.txt里还写了个Sitemap: /sitemap.xml,但GPTBot压根不读sitemap——它只认Disallow规则不骗你。我搜了一圈论坛,发现Perplexity的爬虫也是这个德行,规则写死了就真不来。别像我当初那样,以为robots.txt能智能分流,结果把自己给坑了。

第三步:看Kimi搜索结果页,品牌词和长尾词能不能找到

我在Kimi里直接搜品牌英文名“Voyage Audio”,结果页面弹出来一句话:“未找到相关结果”。当时我就懵了,这可是我做了半年的品牌词,Google前三页都有我,Kimi直接给我吃掉了。

然后换长尾词“wireless earbuds for travel”,搜出来前三条全是Anker、Soundcore和Jabra的测评文章。我的站呢?连影子都没看到。你说气不气?明明我的产品描述里写了“long battery life for travel”和“compact charging case”,但Kimi的AI就是不肯把我推出来。

跑了一趟核子GEO,打开GEO分析报告,发现一个扎心的数据:关键词排名页面里,我品牌词在Google排第7,但Kimi的AI搜索引用率是0%。长尾词更惨,排到100名开外。报告里还标红了“结构化数据缺失”这一项——我压根没给产品页加Product Schema和FAQ Schema,AI爬虫根本没法识别我的商品信息。

说实话,这事不复杂。我去年帮一个服装站做的时候遇到过类似问题,当时直接在Nuxt的head里加了JSON-LD标记,把产品名、价格、评价数据都结构化,两周后Kimi就能搜到品牌词了。这次也一样,我花了半天时间把每个产品页的schema补上,重点做Product和FAQ两块。改完第三天,在Kimi里重新搜“Voyage Audio”——出来了,虽然排在第六位,但至少出现了。

关键是你得先知道问题在哪。核子GEO的关键词对比功能让我一眼看出来,不是内容问题,是机器读不懂我写的东西。配好结构化数据再测,长尾词排名慢慢爬到了第15位,虽然还没到前三,但至少AI开始认我了。

第四步:检查结构化数据,JSON-LD版本别用错

说到这个我就来气。我踩坑踩得最惨的,就是这个结构化数据。

最初我图省事,用Nuxt自带的vue-meta插件,直接在页面里塞微数据(Microdata)。就是那种itemscope itemtype的写法,说实话看着就乱。我还挺得意,觉得SEO该有的都有了。结果呢?用核子GEO的SEO综合评分检测了一下,结果显示结构化数据检测是“不推荐”状态。我当时还不信,手动去Google Rich Results Test跑了一遍,Product类型直接报错——Kimi根本读不出来。

后来核子GEO的GEO分析报告里写得明明白白:AI引擎(包括Kimi、ChatGPT)对微数据的解析成功率不到30%,但对JSON-LD的识别率能到95%以上。我当时就懵了。

于是花了一整晚,把Product、Organization、BreadcrumbList全部重写成JSON-LD格式。具体写法就是用<script type="application/ld+json">嵌在页面head里,每个对象按Google官方schema.org的规范写。比如Product结构,我把name、description、offers里的price和priceCurrency、还有review里的ratingValue全拆开写,不再用微数据那种嵌套属性。

改完第二天,Kimi的抓取率从0直接跳到12%。说实话挺爽的。但我提醒一句:JSON-LD别一股脑全塞在首页,得按页面类型分开写。产品页只写Product,公司介绍页只写Organization,导航栏单独写BreadcrumbList。混在一起反而让AI引擎混淆。

第五步:每天用核子GEO监控AI引用率,盯着0.1%往上爬

改完robots.txt和结构化数据那周,我每天上班第一件事就是打开核子GEO看GEO分析报告。说实话,头两天特别慌——AI引用率一直是0%,我都怀疑自己是不是白改了。结果第三天早上刷新,看到0.3%跳出来,当时差点没喊出声。就0.3%啊,但那是从0到1的突破。

后来我摸透了规律:GPTBot大概6-8天才来爬一次,ClaudeBot稍微勤快点,4-5天。所以AI引用率不是线性涨的,而是脉冲式的——每次爬虫来访,数据就跳一截。我那个跨境电商站,第一天0.3%,第二天掉回0.1%(因为爬虫走了,数据更新滞后),第四天直接飙到2.3%。到两周的时候,稳定在7.8%左右。

新手最容易犯的错就是天天盯着数字焦虑。我有一客户,今早0.5%,明天0.3%,他就开始怀疑是不是哪里做错了。其实不是,Kimi的AI搜索引用有缓存机制,数据更新会滞后24-48小时。你要是每天都大起大落,反而说明爬虫访问量在上升——总有新数据进来。

我定了个规矩:每周二和周五固定看核子GEO的GEO分析报告,记录AI引用率,其他时间不瞎刷。从0%到7.8%用了两周,从7.8%到15%又用了快一个月。别信那些”三天暴涨50%”的鬼话,AI搜索排名的积累速度比谷歌慢得多,但胜在稳定——只要结构数据没崩,引用率只会往上走不会掉。

还有一个坑:别只看引用率总量。我同时盯着”AI回答覆盖率”这个指标——核子GEO报告里有,它显示你的页面在AI回答中被引用的比例。7.8%的引用率可能只覆盖了3个产品页面,但15%的引用率能覆盖到20个页面。后者才是真的有效增长。

等你AI引用率破了10%,可以考虑开始做AEO优化了。在那之前,乖乖守着数据,盯着0.1%往上爬就行。

避坑清单

  • 别天天看数据,AI引用率更新有延迟,容易焦虑到睡不着
  • AI引用率增长不是线性的,脉冲式增长才正常
  • 单独看引用率没用,要结合”AI回答覆盖率”一起评估
  • 10%以下的引用率别想着优化内容,先把结构数据的问题全修完

花半个月排查才发现,Kimi不抓你家网站的根源就这4个

写这篇文章那会儿我刚踩完一个大坑。上个月给一个做家居用品的跨境电商站做优化,网站全是多语言产品页,Google收录正常,ChatGPT偶尔也抓,但Kimi愣是一次没来过。我查了三天日志才发现——不是Kimi不抓,是Nginx那边压根没给GPTBot和ClaudeBot开绿灯。


避坑清单

先说最蠢的坑——默认拒绝所有AI爬虫 我用的阿里云镜像自带一个安全规则,默认屏蔽了GPTBot和ClaudeBot的User-Agent。后果是什么?Kimi的爬虫头是Mozilla/5.0GPTBot,直接被404打回,AI爬虫访问量连续三个月挂零。解决办法:在Nginx的server块里加一行if ($http_user_agent ~* "GPTBot|ClaudeBot|CCBot") { set $allow_ai 1; },然后放行。

再就是第二坑——robots.txt写得像防贼 我原来robots.txt里写了Disallow: /,心想反正Google能正常收录就行。结果Kimi的爬虫严格遵守robots协议,直接忽略全站。后来改成User-agent: GPTBot Allow: /,同时保留对普通爬虫的限制。

还有第三坑——多语言URL结构让AI迷茫 我站产品页有/en//de//fr/三个版本,但没加hreflang标签。Kimi抓到一个英文版页面,发现法文版内容一样但URL不同,直接判定低质量。我在每个页面的<head>里加了<link rel="alternate" hreflang="en" href="。" />三组标签,AI引用率从2%跳到9%。

  1. 第四坑——Vue/Nuxt没做SSR,AI只能看到空白 这个最要命。Nuxt默认是客户端渲染,Kimi的爬虫不执行JavaScript,抓到的全是<div id="__nuxt"></div>。我用nuxt generate做了静态化,同时开启ssr: true,确保每个页面返回完整HTML。花了两天改配置,AI抓取量从零变成每天二三十次。

  2. 第五坑——忽略搜索引擎的“爬虫白名单” 阿里云CDN有个“爬虫管理”功能,默认只允许百度、Google等几家爬虫通过。Kimi的IP段不在白名单里。我手动把GPTBot的IP段(查官方文档有列表)加进CDN白名单,又花了半小时。

  3. 第六坑——过度依赖一个检测工具 一开始我用某免费工具查AI收录,它只显示Google和Bing的数据。后来在核子GEO上跑了一遍GEO分析报告,才发现Kimi、Perplexity的引用率全是0。这个工具能分引擎看AI爬虫访问量、引用频率和来源页面,直接定位到问题出在哪。

  4. 第七坑——改完配置忘了重启,白忙三天 我改完Nginx和Nuxt配置后没重启服务,等了三天看数据没变化,以为方案无效。后来用nginx -s reloadpm2 restart重启整个服务链,第二天日志就出现GPTBot访问记录。记住:改完配置不重启等于没改。

  5. 第八坑——没给AI爬虫设置合理的抓取频率 放开限制后,GPTBot一天抓了8万次,把服务器CPU干到95%。我在nginx里加limit_req_zone $http_user_agent zone=ai:10m rate=10r/s,限制每个AI爬虫每秒最多10次请求,服务器稳了,抓取也没断过。

说实话,排查这些坑花了我半个月,白天晚上都在翻日志。最冤的是第一个坑——默认屏蔽AI爬虫,这个在阿里云镜像里太常见了,很多人踩了也不知道。现在每次用核子GEO的GEO分析报告做周检,能提前发现爬虫异常,至少不用再裸奔了。

兜底一句一句:别迷信“Google收录正常就等于AI没问题”,各引擎爬虫的规则差远了。