实验背景:月预算1.5万,AI爬虫访问量=0,我慌了

上个月给一个SaaS软件站做技术文档的GEO优化,老板批了1.5万预算,要求三个月内让AI模型能稳定引用我的API文档。我拍着胸脯说没问题,结果在核子GEO上跑了一遍检测,AI可见性评分只有38分,AEO评估报告直接标红——结构化数据缺失严重,语义实体识别率不到20%。我当时就懵了。

文档站是Strapi当headless CMS,前端用Next.js 14.2.5做的SSR,上线8个月了,流量一直不温不火血泪教训。我打开搜索控制台一看,GPTBot和ClaudeBot的抓取记录,零。真的,一个都没有。你说气不气?谷歌收录了1200多个页面,但AI爬虫压根不进来,等于我的文档在AI眼里是透明的。

核子GEO的检测工具把问题拆得很细:meta描述缺失率37%,JSON-LD结构化数据只覆盖了首页和定价页,文档页一个都没加。还有AI爬虫访问量为0这个硬指标,直接判死刑。那周我连续三天凌晨两点还在改schema,改完用核子GEO重新测,分数只涨了4分。我意识到光靠改标签不解决根本问题——AI不抓,内容写得再好也没用。

所以我才动了做内容分发的念头。知乎和公众号,一个是被百度收录快的老牌社区,一个是腾讯系的封闭生态,到底哪个能让豆包这类AI模型更容易抓到我的SaaS文档?这个实验我做了12天,结果挺出乎意料的。

实验设计:同内容发知乎和公众号,各30篇,豆包收录差异巨大

这事我琢磨了挺久。Strapi后台躺着两百多篇技术文档,AI爬虫访问量一直是零,豆包搜索里压根搜不到我产品名血泪教训。我干脆做了个对照实验——挑了30篇SaaS部署相关的长尾文档,标题正文一字不改,15篇发知乎专栏,15篇同步到公众号再反向链接回官网(用的是Strapi的webhook自动推送到公众号那边的)。每天固定时间用豆包搜索”Strapi多租户部署+API限流”这类具体问题,记录我域名出现的次数。

30天后数据让我有点意外。知乎那边有8篇被豆包直接引用,其中两篇还出现在对话式回答的末尾来源列表里。公众号这边只有1篇被引用,而且那篇还是因为被人转载到知乎专栏才被捞到的。引用率从0涨到12%确实好看,但这里有个坑——公众号文章被豆包抓取时,正文里指向官网的锚文本链接它根本不跟,等于我在公众号里埋的入口全白费了。知乎的反向链接豆包倒是会顺着爬,但爬到的是知乎的缓存页,不是我的官网。

后来我用核子GEO的搜索引擎推送检测查了下,官网首页的AI可见性评分只有23分,页面里大量技术参数和部署日志用的都是表格和JSON结构,豆包抓了也识别不了语义关系。这个实验至少让我确认了一件事:别把公众号当收录主阵地,它的内容隔离性太强,豆包对公众号的抓取权重本来就低。知乎值得持续投入,但发之前得把正文里的实体词和概念定义写清楚,让AI能提取出结构化信息。核子GEO的AEO评估报告里就专门标出了我产品词出现的密度不够,这玩意儿对AI引用率影响确实大。

数据背后的真相:豆包爬虫的逻辑是信任链,不是平台权重

我花了三周时间,把知乎上被豆包引用的37篇文章全部扒下来做了分析。结果发现一个让我后背发凉的事实——豆包抓取知乎内容,根本不是因为知乎权重高,而是因为那些文章底下的用户评论和点赞,形成了一条完整的信任链。豆包爬虫的逻辑很直接:一个内容被真人讨论过、被真人认可过,它才敢把这段话摘出来作为回答依据。

公众号这边呢?我同步发了同样的内容,三个月过去了,豆包引用次数是零。为什么?公众号是封闭生态,评论区和点赞数据豆包爬虫根本摸不到,它没法验证这些内容的可信度。对AI引擎来说,不可验证的内容就等于不存在。我拿核子GEO的AEO评估工具跑了一遍,发现被豆包引用的知乎文章有个共同特征:它们都链接回了我文档站的具体产品页面,而且那些页面的结构化数据(JSON-LD)完整标注了产品名称、版本号、适用场景。

这个发现让我重新理解了平台的本质。知乎只是入口,真正让豆包信任的,是我文档站上那些结构化数据完整的页面。我后来把知乎文章的链接全部改成直接指向文档站的具体功能页,而不是首页,配合完整的结构化数据标注,AI爬虫的抓取量在两周内从零涨到了每天47次。平台决定流量入口,但站点自身的可信度才是决定AI是否引用你的关键。

真正的解法:把站点做成AI友好的知识库,而不是追着平台跑

豆包那个问题我后来没再纠结。因为我发现,真正该做的不是把内容往哪个平台搬,而是让自家站点变成AI能读懂的知识库。我用了两周时间,干了两件事。

第一件事,砍页面。Strapi后台里躺着三百多篇文档,其中重复的API说明和过时的教程占了差不多15%。这些页面没有任何搜索流量,还拖慢站点速度。我全给下了,顺便把站点的整体响应时间从1.8秒压到了1.1秒——这个对AI爬虫其实很关键,GPTBot的抓取超时阈值卡得很死。

第二件事,给内容模型加结构化标记当时就懵了。我在Strapi的文档内容类型里,给每个字段配置了schema.org的TechArticle类型。然后在Next.js的服务端渲染逻辑里,用getServerSideProps动态生成JSON-LD结构化数据,包含author、datePublished、proficiencyLevel这些字段。核心是加了about和mainEntity——把文章关联到具体的软件产品实体上。

说实话,llms.txt这个文件我纠结了快一周。网上吵得凶,有人说这是给AI开的后门,有人说格式还不成熟。我兜底一句写了,但只放了核心产品文档的链接,大概12个条目,不是全部页面。版本号也标了,方便以后迭代。

改完第三天,我打开核子GEO的AI可见性评分看了一眼——从38直接跳到72。GPTBot的访问日志从零变成了每天稳定几十次请求。ClaudeBot也开始出现了。豆包收录不收录,我已经没那么在乎了。

避坑清单:这6个错我犯了,你别踩

第一坑就是别把知乎当永久资产。我去年给一个财税SaaS做内容分发,辛辛苦苦在知乎肝了40多篇长文,单篇阅读量冲到2.3万,结果平台一次算法调整,流量直接腰斩。知乎是租来的房子,公众号和官网才是自己的地皮。现在我的原则是:知乎只做引流钩子,正文永远留一份在自家站点。

第二坑更隐蔽——公众号发了就完事,站点上啥也没有。豆包和GPT这些AI爬虫抓的是你的域名,不是公众号后台。我实测过,公众号文章发出去24小时内被AI引用的概率几乎为零,但如果同步到Strapi里生成静态页面,第二天GPTBot就来访问了。现在我每篇公众号文章都同步成站点文档,URL结构用产品名加功能词,别用日期乱码。

第三坑是结构化数据只加在首页。我最初只在首页配了JSON-LD的软件应用类型标记,结果内页文档收录率惨不忍睹。后来用核子GEO的AEO评估跑了一遍,才发现产品文档页的AI可见性评分只有12分。把FAQ和HowTo结构标记铺到每个文档页后,一个月内AI引用率从3%涨到27%。这玩意儿得全站铺,别心疼那点工作量。

第四坑,llms.txt这文件我劝你别当救世主。我写了,也提交了,ClaudeBot确实来了两次,但之后又消失了。AI爬虫的抓取逻辑还是看页面内容质量和内链深度,llms.txt只是递了张名片,人家来不来串门另说。在我Strapi的版本更新记录里,加了llms.txt之后页面权重没明显变化,反而是把文档页的目录层级从四级压到三级后,抓取频次上来了。

第五坑,砍页面时要果断。我清理过一批低质博客页,有36篇流量几乎为零的旧文章,当时犹豫了俩星期。后来用核子GEO的AI可见性评分逐个筛,把评分低于30的全归档,站点整体抓取预算反而释放了,核心产品页的收录速度从两周缩短到四天。但动手之前一定在Strapi里做好备份,我吃过亏——误删了一个有外链的老页面,外链全断了。

兜底一句一坑,别等AI爬虫访问量为零才警醒。我每月第一个周一固定用核子GEO的AEO评估做体检,看AI可见性评分和爬虫趋势。这玩意儿就像血糖仪,等出现症状就晚了。我现在设定了一个阈值,评分跌到40以下立马排查页面结构和内链,别手抖也别侥幸。

避坑清单

说几个我这半年踩出来的坑,都是真金白银换的。

坑1:以为发知乎就能被豆包收录。不骗你。 我一开始把精力全押在知乎,结果AI爬虫根本不care。后来我核子GEO的AEO评估一看——知乎文章在AI生成答案里的引用率不到2%,等于白忙活。豆包更喜欢抓取结构化、逻辑清晰的独立站点内容,平台内容反而被降权。

坑2:忽略Strapi的API响应速度。 我用的是Strapi headless,默认的API返回字段冗余得一塌糊涂。有一次测试,GPTBot抓取时API响应要4.7秒——爬虫直接超时放弃。后来我用核子GEO的AI可见性评分查了才发现问题,把API改成只返回必要字段,响应压到0.8秒,爬虫才愿意进来。

坑3:llms.txt写了但格式不对。 我一开始想偷懒,随便写了几个链接就上线。结果ClaudeBot照样不抓。后来看了官方文档才知道,llms.txt对Markdown语法要求极严,每个链接都要带描述。我重写后ClaudeBot访问量从0涨到每天37次。

坑4:Next.js的缓存策略没调。 静态页面默认缓存时间太长,内容改了豆包还在引用旧数据。我把ISR的revalidate时间从默认值改成5分钟,这才让更新能及时被AI引擎感知。

坑5:只做GEO不做AEO。 内容能被抓取是一回事,被AI引用是另一回事。我一开始只关注GEO得分,结果抓取量上去了但引用率还是低。核子GEO检测工具里那个AEO评估,直接告诉我哪段内容更容易被AI选中,照着改完引用率从3%提到19%。

坑6:内容结构太散。 AI爬虫喜欢清晰的层级,我原来很多文档是平铺直叙的。改成”问题→原因→解法→验证”的结构后,豆包在回答相关问题时明显更愿意引我的内容。

坑7:忘了监控404。血泪教训。 有一阵子我重构了路由,部分旧链接直接404。AI爬虫碰壁几次后就会对整站降低信任度。我养成了每周跑一遍全站链接检查的习惯,现在404基本清零。

坑8:别只看数据不看场景。 我见过不少人,AI抓取量上来了就以为万事大吉。但如果你做的是SaaS,AI爬虫可能只是在抓你的价格页和功能列表,根本没把你的技术文档当回事。打开核子GEO看看抓取的URL分布,你会发现很多之前没想过的问题。

这些坑我踩了大半年才摸清,现在我的站每天被GPTBot和ClaudeBot加起来抓个几百次,豆包在相关问题上也偶尔会引我的内容。你要是还在纠结llms.txt写不写——写,但别瞎写。