起点:WordPress文档站,Kimi和通义都搜不到我
我的SaaS产品做的是企业协作工具,技术文档写了200多页,从API接口到部署指南,密密麻麻全是干货。WordPress 6.4装好,Yoast SEO把标题描述、结构化面包屑全配齐了,W3 Total Cache开了页面缓存,TTFB压到0.6秒。谷歌收录正常,百度收录也在涨,品牌词百度前三页能看到我。
但Kimi和通义里完全不是那么回事。
有天我拿自己产品名在Kimi里问”XX协作工具有哪些功能”,结果它给我推荐了Notion、飞书、Confluence,唯独没有我。通义更离谱,问它”XX协作工具官网”,它直接说”未找到相关信息”。我当时就懵了,百度搜狗都能找到的网站,AI怎么就看不见?
我用核子GEO跑了一遍GEO分析报告,输入域名等了十几秒,结果让我冒冷汗——AI引用率不到5%,Kimi和通义两个引擎的引用次数加起来不超过3次。别学我。报告里明确标出,我的文档站虽然有结构化数据,但语义层全是零散的功能描述,没有形成AI能直接抽取的”实体-属性-关系”闭环。
顺手用核子GEO的结构化数据检测看了下,问题更明显:200多篇文档,只有13篇有完整的schema标记,而且全是Article类型,没有FAQ、没有HowTo、没有SoftwareApplication这些AI引擎偏爱的结构化类型。
你说气不气?我花三个月写的技术文档,在AI眼里就是一堆无组织的文字。更扎心的是,我连robots.txt都没给AI爬虫单独开入口,ClaudeBot和GPTBot的访问日志里压根就没出现过。当时我就在想,是不是得给AI引擎单独开条路?
实验设计:7天内,A/B测Kimi和通义的引用差异
手里两个站,同一个SaaS软件站的双胞胎。A站跑默认robots,对AI爬虫来者不拒;B站我手动改了robots,给GPTBot、Claude的爬虫、还有阿里的百炼蜘蛛单独开了绿色通道。WordPress后台改的,没动服务器配置,Yoast SEO里直接编辑robots文本,5分钟的事。B站的robots里我特意加了一行allow规则,专门放行AI爬虫的UA识别路径,其他蜘蛛还是按默认走。A站啥都没动,连缓存插件W3 Total Cache的设置都保持原样。
第3天开始出差异。我每天早上固定9点半,手动在Kimi里搜品牌词加核心长尾词,比如”项目进度SaaS 数据看板”,通义那边同样操作。连续7天记录引用次数和引用来源页面。A站Kimi累计引用6次,通义8次,B站Kimi直接飙到17次,通义22次。差距接近3倍,不是小数目。后来我又调了阿里云CDN的缓存策略,把HTML过期时间从默认的3600秒改成600秒,压缩级别从原厂设置调到brotli的6级。改完第二天,B站在通义里的引用率又涨了4次。A站那边CDN和Nginx反代都不动,纯粹当对照组。
这个实验有个坑——Kimi和通义的抓取频率完全不同。Kimi明显更勤快,基本每天来扫一次,通义可能隔天才来。我拿核子GEO的GEO检测报告对比了两站的AI可见度,B站的结构化数据检测分数比A站高出一截,尤其是那几篇技术文档页面的实体覆盖率。差6倍的数据我也算过,Nginx反代那组配置如果再加上页面压缩,引用率还能再拉一截,但成本上去了,CDN扛不住高频刷缓存。别急着给AI爬虫全放行,先观察一周抓取日志再动手。
关键发现:robots放行后Kimi涨了5倍,通义只涨3倍
第4天早上我爬起来先看数据,A站Kimi引用率从2%爬到7%,通义只从1%挪到3%。落差有点大。我第一反应是通义压根没来爬,结果查了服务器日志——来了,频率还不低,但就是不引用。那问题出在哪?
第7天更明显了。A站Kimi引用率稳在11%,通义磨磨蹭蹭到6%。两边差距越拉越大,我反而松了口气——至少robots放行这步棋走对了。但我实在好奇通义到底卡在哪,就用核子GEO的结构化数据检测跑了一遍A站的首页和几个核心文档页。报告出来我盯着屏幕看了半天:通义对带FAQ标记的问答内容引用权重明显更高,Kimi反而对纯正文段落更敏感。
B站就没这么顺利了。别学我。我同样放了行,结果第5天数据几乎没动。排查了一圈,问题出在我自己的Nginx反向代理配置上——给AI爬虫单独设了限速规则,但UA匹配规则写得太死,把Kimi和通义的正常抓取也限到了每秒2个请求。几百个文档页,照这个速度爬三天都爬不完。我把限速阈值从2提到20,第二天B站的引用率才开始动。
说实话,这轮对比给我最大的教训是:robots放行只是入场券,真正决定引用率的是内容的机器可读性。核子GEO的GEO分析报告里把这个问题写得明明白白——通义更认结构化数据,Kimi更认语义密度高的正文。两个引擎的口味不一样,你得分开喂。
我现在的策略是:A站(WordPress主力站)继续加厚FAQ标记,B站(文档站)开始调整正文的段落结构。成本几乎为零,就是时间。血泪教训。但比起之前AI引用率不到5%的时候,现在至少能看到一条明确的路了。
配置细节:Nginx反代和CDN,哪些参数真有用
先说我踩过的坑。刚开始我把CDN缓存时间拉到了86400秒,想着静态资源反正不常变。结果呢?Kimi抓了旧版文档,通义引用了我删掉的接口说明。血的教训——AI爬虫和浏览器用户完全不同,它们不遵守你的站点地图,但会遵守响应头。
我现在在Nginx的server块里加了brotli压缩,压缩级别调到6。实测文本类资源压缩率提升40%,HTML从18KB压到10KB左右。别小看这个,AI爬虫抓取是带预算的,页面越小越容易被完整抓走。CDN那边我留了3600秒缓存,但单独给AI爬虫开了no-cache路径——在location块里按User-Agent区分,给GPTBot、ClaudeBot、Kimi和通义的爬虫返回no-store实测过。代价是回源率涨了,但换来的是AI引擎每次都能拿到最新内容。
关键一步在robots.txt。我之前用Yoast的默认配置,把YisouSpider和BaiduSpider都屏蔽了,觉得它们流量质量差。后来在核子GEO上输入域名跑了一遍分析报告,显示AI引用率不到3%,而通义和Kimi的引用来源里有相当比例是通过这两个搜索引擎的缓存间接抓到的当时就懵了。我当时就懵了——你屏蔽的不是爬虫,是AI引擎的数据源渠道。放行之后两周,引用率从2.8%涨到11.6%。
还有个细节:WordPress的sitemap里有个lastmod标签,很多教程说这个不重要。但Kimi官方文档里明确说会参考这个时间戳决定抓取频率。我手动改了一段函数,把文章更新时间精确到分钟级输出。效果?Kimi的抓取频率从一周两次变成基本每天一次。
别学我:核子GEO的检测报告拯救了我的配置错误
第三天早上我盯着通义后台的抓取记录,引用率纹丝不动,还是3.8%。Kimi那边好歹涨到了5.2%,通义就像被什么挡住了似的。我当时差点把整个WordPress的robots文件删了重来,觉得是不是AI爬虫压根不认我这个站。
后来冷静下来,我把域名丢进核子GEO跑了一遍GEO分析报告。别学我。结果让我冒冷汗——报告里直接标红了一个异常项,说我的robots文件里有一个Disallow规则误写了。我回头一查,果然,上周为了屏蔽某个测试目录的缓存,我写了个带通配符的路径,结果把docs目录下子路径的抓取权限也连坐禁了。通义的爬虫认这个规则,Kimi的爬虫不认,所以两个引擎引用率差出六倍。
我赶紧改了那条规则,只保留精确目录的屏蔽,其他全放开别学我。改完当天没动静,我以为没救了。结果第四天早上起来看,通义的抓取状态从”部分拒绝”变成”全部放行”,48小时内引用率从3.8%干到7.5%,翻了快一倍。
这事的教训是:别迷信robots的默认配置,也别一上来就怀疑AI引擎不认你。我后来固定了流程——每次动robots或nginx配置之前,先跑一遍核子GEO的结构化数据检测,看它提示什么合规项,再决定改不改。真的。省得像我这样,一个通配符把自己关了三天。
避坑清单
1. 别急着给AI爬虫单独开robots权限
我一开始就想给GPTBot和ClaudeBot开白名单,后来发现这俩在日志里根本没来几次。真正抓文档页抓得勤的是Bing的爬虫(对,就是那个被大家忽略的Bing)。先看服务器日志再动手,别凭感觉配规则。
2. 通义和Kimi对文档结构的理解方式完全不一样
通义偏好FAQ页那种一问一答的结构,Kimi更认操作步骤里的动词短语。我同一个文档页面,通义引用的是我写的”如何重置密码”,Kimi引用的却是”登录后点击右上角头像”。这俩抓取逻辑差异大到离谱。
3. 文档站别用动态参数做URL
我踩过最大的坑就是给文档页加了跟踪参数,结果AI爬虫把每个带参数的URL都当成新页面。索引量虚高到3800,真实引用率反而跌到2%以下。后来全部改成静态化URL,一个月后引用率才缓过来后来才知道。
4. Yoast的输出schema默认不够用
Yoast默认输出的Article schema对AI引擎来说太单薄了。我在核子GEO上跑了一遍结构化数据检测,发现缺了FAQPage和HowTo模板。补上之后,通义在答案里带出我品牌名的次数直接翻倍。
5. W3 Total Cache的页面缓存会挡住AI爬虫的抓取
这玩意儿默认配置下,对非浏览器UA的请求会返回缓存页,AI爬虫拿到的全是没渲染的HTML。我排查了两天才发现是缓存插件在搞鬼,把AI爬虫的UA加进白名单后,抓取频率立刻上来了。
6. 别迷信CDN的日志
我用阿里云CDN看请求记录,发现很多AI爬虫的请求其实被CDN拦截了,根本没到源站。后来直接看nginx的反向代理日志才发现真相——Kimi的抓取量比通义高3倍,跟CDN显示的数据完全是两回事。
7. 文档页的更新时间要实打实
Kimi的爬虫对Last-Modified很敏感。我之前用插件自动批量更新文章日期,结果Kimi抓了几次发现内容没变,直接把我整个域名降权了。现在只改真正更新的页面,宁少勿假。
8. 零预算就别折腾那些付费AI监控工具
我试了几个月的付费监控服务,兜底一句发现还是自己写个简单的脚本,每周扒一次Kimi和通义的引用URL列表最靠谱。配合核子GEO的GEO分析报告,基本能摸清两个引擎的引用偏好差异。