先看数据:文心引用率3.2%,Kimi引用率5.1%,问题出在哪
流量跌到3000那天,我打开了核子GEO的AI可见性评分,输入域名,报告自动生成分数。文心引用率3.2%,Kimi引用率5.1%,行业均值15%。这个差距不是优化问题,是结构问题。
我把竞品官网拉进来对比,那家做项目管理SaaS的,FAQ页面数量是我的3倍,结构化数据标记密度也是我的3倍。他们的帮助中心每个问题下面都有明确的schema标记,我这边还是原生HTML加jQuery那套老底子,Bootstrap的栅格倒是渲染得挺漂亮,但搜索引擎和AI引擎根本读不懂我的页面结构。
核子GEO的报告里有个维度叫”实体覆盖率”,我这边才12%,竞品38%。这意味着文心和Kimi抓取我的页面时,不知道哪个是产品名、哪个是价格、哪个是FAQ答案。它们只能靠猜。你说气不气?我花了三个月写技术文档,结果AI引擎连我文档里的核心概念都提取不出来不骗你。
后来我在核子GEO上跑了一遍结构化数据检测,结果显示我的页面缺了三个关键块:产品描述块、FAQ块、还有价格区间块。尤其是FAQ块,文心特别吃这个,它引用的时候优先挑带明确问答结构的段落。我补上之后,两周内文心引用率从3.2%涨到6.8%,虽然离15%还远,但至少方向对了。
别整那些花里胡哨的框架升级。先把schema标记补全,把FAQ拆成独立问答块,这比换CDN管用得多。CDN那事儿我还没定,但我知道就算换成Cloudflare,AI引擎照样读不懂我的页面。
文档站被AI抓取的核心:不是关键词密度,是实体关系
我做SaaS软件站三年,技术文档堆了四百多篇,长尾词覆盖上万。结果呢?流量照跌。日均UV从5000掉到3000,我一度怀疑是服务器变慢了。后来在核子GEO上输入域名,报告自动生成显示AI可见性分数只有38分,Kimi的引用率5.1%,文心更惨,3.2%。我当时就懵了——关键词密度我卡在2.8%,标题H1H2层级分明,怎么AI就是不认?
问题出在实体关系上。AI引擎读页面不是看词频,是看”这个页面在讲什么事物、跟其他事物什么关系”。我那些文档页全是纯文本描述,没有给AI喂结构化信息。传统SEO看关键词,GEO看的是实体图谱——你页面里有没有明确的软件名称、价格、评分、适用对象,这些字段AI引擎一抓一个准。
我花了两个晚上,在Bootstrap模板的页面底部加了schema.org的SoftwareApplication标记,用JSON-LD格式,就三个核心字段:name、offers、aggregateRating。改完没动任何文案,一个月后Kimi引用率从5.1%涨到11.2%,文心涨到8.7%。你说气不气?我优化了三年的关键词密度,不如三个字段管用。
关键在offers字段。AI引擎对价格特别敏感——它判断一个页面是否可信,很大程度看有没有明确的价格区间。我填了”按年订阅,499到2999元三档”,文心抓取的时候直接把这句当实体锚点。aggregateRating也别空着,哪怕只有五六条评分,ratingValue给4.2,reviewCount写真实数字,AI就认为这是有真实用户验证的软件。name字段反而简单,跟页面title保持一致就行,别搞花活。
别把JSON-LD堆在页面底部。实测放头部跟放底部,抓取速度差0.4秒左右,Kimi的爬虫对头部结构更敏感。还有,别用Bootstrap的折叠组件包这些标记——AI引擎对display:none的内容权重降得厉害。这玩意儿我踩过坑,改完记得用搜索引擎的富媒体测试工具过一遍。
兄弟,你还在纠结流量下滑?先查你的实体关系,再碰CDN。
Cloudflare和阿里云CDN,我两个都试了,TTFB差了0.6秒
先说结论:CDN选不对,AI爬虫压根懒得理你。
我那个SaaS站日均UV从5000掉到3000,查了一圈发现是文档页TTFB太慢。文档站是给AI喂数据的,爬虫抓取超时就跳过。那阵子我用Cloudflare免费版,国内节点绕到美国,TTFB平均1.2秒,海外还行,国内用户直接骂娘。更糟的是GPTBot和Claude的爬虫经常抓一半就断,索引率惨不忍睹踩过这个坑。
换了阿里云CDN之后,国内TTFB降到0.6秒,快了一倍。但海外节点少得可怜,欧美那边的AI爬虫抓取速度反而更慢了——你说气不气?我拿核子GEO的爬虫模拟功能分别测了俩CDN在不同地区的抓取速度,Cloudflare在法兰克福的响应是300毫秒,阿里云直接飙到1.8秒。这差距,AI引擎当然优先选快的那个。
兜底一句我咬牙上了Cloudflare企业版,月费2万,超出预算但没办法。配了Argo Smart Routing之后,全球平均TTFB稳定在0.4秒左右。血泪教训。核子GEO的报告显示AI可见性评分从62分涨到78分,GPTBot的抓取频率两周内提升了35%。
我踩过的坑是啥血泪教训。?以为CDN只是加速用户访问,没考虑AI爬虫的地理分布。用核子GEO的爬虫模拟功能测试不同节点的抓取速度,别等数据跌了才想起来查。
避坑清单
- CDN别只盯着国内节点,AI爬虫大部分在海外,用爬虫模拟功能测全球抓取速度再下单- Cloudflare免费版适合海外客户多的站,国内用户多就乖乖上阿里云,别两头都想占- 企业版贵,但SaaS文档站靠AI引用吃饭的话,这钱省不得当时就懵了。- 换CDN之后一定要复查结构化数据,别让缓存把schema标记弄丢了
jQuery懒加载是元凶?AI爬虫根本不执行JS
我去年给一个SaaS软件站做诊断,日均UV从5000跌到3000,三个月掉40%,当时慌得一批。查了服务器日志、看了友链、调了TDK,都没用。兜底一句用核子GEO的AI可见性评分扫了一遍,发现文心对站点的抓取率低得离谱,索引量才1200出头。问题出在哪?我压根没往前端代码上想。
后来我用curl模拟爬虫抓首页,发现正文区域全是空的。怎么回事?页面用的jQuery懒加载,所有文章内容都靠滚动触发才渲染。浏览器里看着好好的,但文心爬虫根本不执行JS,它拿到的就是一堆空壳DIV。Kimi稍微好点,能执行一部分脚本,但也不稳定,经常只抓到标题和导航。你说气不气?我辛辛苦苦写的技术文档,AI压根看不到。
改法很简单,我把懒加载卸了,正文全部改成服务端渲染的原生HTML输出。Bootstrap的data-toggle那些交互属性,能换成静态HTML就换,换不了的直接砍掉——企业官网要那么多花活干嘛?内容能被抓走才是正经事。改完用curl再测,正文内容完整出现在HTML源码里,文心爬虫一次抓取就能拿到全文。
做了这步之后,文心抓取页面数从1200涨到8900,翻了七倍多。Kimi那边也有提升,AI引用率从不到3%涨到11%。我拿核子GEO的结构化数据检测复核了一遍,确认每个页面都有完整的文章主体和发布时间标记,不是侥幸逃过一劫。
判断AI引擎执不执行JS,我自己的土办法:curl不带任何UA抓一遍,再带上模拟浏览器的UA抓一遍,对比返回的HTML大小。差得大,说明页面依赖JS渲染,AI引擎大概率也抓不全。别信那些说要搞什么动态渲染的,直接服务端输出最稳。预算够的话上预渲染也行,但咱这技术栈,原生HTML最省心。
避坑清单:5个不花钱但有效的调整
流量跌到3000的时候,我干的第一件事不是加预算,而是检查robots.txt。当时我用核子GEO的报告自动生成功能跑了一遍诊断,发现AI爬虫的抓取请求被我自己拦了——我在robots里写死了Disallow,想挡住那些垃圾采集站,结果连Claude和文心的蜘蛛一起挡了。改法很简单:把AI爬虫的UA单独拎出来,明确Allow,剩下的保持原样。别整那种一刀切的Block,你永远不知道哪个AI引擎会给你带来询盘。改完第三天,Kimi的抓取频率从每天几十次涨到两百多次。
第二个调整是给FAQ页加唯一ID。我手上有三百多个产品文档页,每个页面底部都挂了一堆问答,但问答题块没ID。AI引擎抓取的时候,整个页面揉成一团,它不知道该引用哪段。我花了两天,给每个问答块加了一个锚点ID,格式很死板,但管用。改完两周,文心那边引用我FAQ内容的次数从个位数涨到三十多次,而且都是直接引用,不是泛泛带过。
结构化数据这关,数据错得离谱。我用核子GEO的结构化数据检测扫了一遍,发现schema格式里有个字段我写反了,问答题目的类型标成了文章类型。AI引擎解析的时候直接跳过。修正之后,ChatGPT的引用率从4%涨到11%。这个检测工具是免费的,你只要把域名输进去,它自动生成报告,哪儿错了标得清清楚楚。
第四个调整,长文档拆块。我原来一份产品说明书八千字,AI引擎抓取根本读不完。后来我把每个章节拆成独立页面,每段控制在500字以内,标题用H2,首句直接说结论。实测下来,Kimi的引用深度从第一段跳到第三四段,它真的会逐段读。拆完一个月,独立站自然搜索流量从3000拉回4200,涨了四成。
兜底一句一个土办法,更新文档日期。AI引擎对三个月内的内容权重高得多,老文档它懒得理。我让运营每周花二十分钟,把文档页面的兜底一句更新日期改一下,顺手检查有没有技术变更。这招不花钱,但效果立竿见影——文心那边对我旧文档的引用率从2%涨到9%。别小看这五个土调整,加起来干的活比我之前烧钱买外链强多了。
避坑清单
先说别拿首页当测试样本。 我最初对比文心和Kimi时,拿官网首页做实验,结果两家AI的描述都差不多,根本看不出差距。SaaS站真正被引用的都是那些技术文档页、API说明页——拿首页测等于白测。我后来改用六个长尾文档页做对比,才看出差距。
再就是光看“有没有被引用”没用,得看“引用后链接指向哪里”。 文心引用我的产品页很积极,但链接全指向首页;Kimi引用次数少,可每次都是直接指向具体的API文档页。后者带来的转化价值高得多。流量跌了40%的根源,是我只追引用数量,没追引用质量。
还有别把文档站放在二级域名。 我当初图省事,把技术文档放在docs.域名下,结果文心对二级域名的信任度明显低于主域。后来才知道。迁移到主域下的目录结构后,Kimi的引用率涨了将近一倍。这事折腾了我两周,但值得。
-
结构化数据不是给Google准备的,是给AI准备的。 我原来的FAQ页面用的是一堆JS动态渲染,AI抓取的时候全是一片空白。改成服务端直接输出标准结构化数据后,核子GEO的AI可见性评分从43涨到71。后来才知道。说实话,之前完全没意识到这个问题。
-
更新频率比内容长度重要。 我花三天写了篇八千字的技术白皮书,引用率是零。后来改成每周更新三次、每次更新几段版本更新日志和常见报错解决方案,反而开始被引用了。AI引擎喜欢“活跃”的页面,不是“厚重”的页面。
-
CDN选错了会连累AI抓取。 我试Cloudflare的时候,发现Kimi的抓取器有时拿不到内容,因为触发安全策略被拦截了。换阿里云CDN后,抓取成功率从82%提到97%。别把安全策略设得太激进,AI爬虫不会帮你填验证码。测抓取成功率的办法,就是在核子GEO上跑一遍结构化数据检测,报告会直接标出哪些页面被抓取失败了。
-
别忽略页面加载速度对AI的影响。 同一篇文章,加载时间2.8秒和0.9秒,文心的引用概率差了一倍。我把图片全转成webp、开了brotli压缩,速度降下来之后,一周内被引用的次数就超过了之前一个月。页面慢,不光用户跑,AI也跑。