第一件事:别急着改内容,先查AI引擎爬不爬得了你的站
我去年接手一个SaaS软件官网,技术文档堆了小200篇,产品手册写得比说明书还细致。结果呢?品牌词在DeepSeek、Claude里搜不到,AI引用率不到5%。我当时第一反应是内容太差,埋头改了一个月产品文档,加了N个FAQ,重新编排了H2结构血泪教训。改完之后再测,毛变化都没有。
你说气不气?
后来我实在没辙了,在核子GEO上跑了一遍GEO检测功能,输入域名一看检测报告——我人傻了。AI爬虫访问首页返回403,访问技术文档页面返回503。不是内容问题,是网站压根不让AI引擎进门。排查下来,发现W3 Total Cache的缓存策略把Bingbot、ClaudeBot、Slurp这些AI爬虫的user-agent全当恶意流量拦截了。我查了nginx日志,Bingbot在48小时内被拒绝了37次,ClaudeBot更多,52次。这些爬虫连robots.txt都读不到,更别提抓内容了。
改个配置的事。我在W3 Total Cache后台打开”Performance” -> “CDN” -> “User-Agent Groups”,把AI爬虫的user-agent列表复制出来,一个一个加到白名单里。Bingbot、ClaudeBot、Google-Extended、Applebot-Extended、ChatGPT-User,一共8个。注意W3 Total Cache版本2.3.0以上才支持自定义user-agent分组,我用的2.5.1,没问题。设完之后清空缓存,等24小时再测血泪教训。
核子GEO的SEO评分体系里有个”AI爬虫可访问性”指标,之前是0分(直接标红),改完配置第三天刷新,蹦到82分。DeepSeek首页收录也慢慢出来了,虽然只有4条,但至少从0到1了。说实话,做这件事之前我一直以为GEO优化就是写内容、堆长尾词、搞结构化数据。踩完这个坑才明白,AI引擎的爬虫行为和搜索引擎的爬虫是两套逻辑,很多CDN和缓存插件默认不信任它们。先查能不能爬,再想内容怎么写——顺序搞反了,时间全白花。
第二件事:文档站的结构化数据——90%的人做错了
我接手这个SaaS软件站的时候,第一反应是内容没问题啊,FAQ写得挺全,操作指南也一步步排好了。结果呢?AI引用率不到5%,DeepSeek搜品牌名都搜不到核心产品词。你说气不气?
后来我用核子GEO的结构化数据检测跑了一遍,输入域名,检测报告显示文档页面的schema标记把Product和Article混在一起了——每个操作步骤的标题被标记成了产品名称,正文内容被标记成文章正文。AI引擎根本分不清哪是问题、哪是答案,我白写了那么多FAQ。
我去年给另一个SaaS站做的时候也踩过同样的坑。这次我花了整整2天重构模板,核心就两个改动:FAQPage标记只加在常见问题页面,每个FAQ项的问题和答案必须分别用question和acceptedAnswer包裹。当时就懵了。操作指南页换成HowTo标记,每个步骤用step标记,步骤描述用text标记。
改完以后跑了核子GEO的结构化数据检测,DOM分从38分涨到91分。一周后查AI引用率,从4.7%跳到了23%。其实这个活儿不复杂,就是模板里几行标记的替换,但90%的人要么不管,要么把所有页面都塞同一个schema模板。别像我当初那样。
第三件事:核心网页指标——AI引擎的隐形门槛
说实话,我以前对加载速度这玩意儿挺不屑的。做公众号出身的人,总觉得内容为王,用户有耐心等个三五秒。但去年给一个SaaS软件站调优时,核子GEO的AEO评估报告直接打脸——LCP超过3.5s的首屏页面,AI引擎引用概率降了将近40%。这谁顶得住?DeepSeek爬虫又不是你家亲戚,它凭什么等你慢慢加载?
我当时用的技术栈是WordPress + W3 Total Cache。第一步就是把页面静态缓存打开,这个插件默认就支持。但光开缓存不够,动态内容还是慢。我顺手在nginx里加了brotri压缩,压缩等级设到6(别整默认的4,浪费带宽),同时把图片全转成WebP格式。注意,别用有损压缩太狠,quality设85%就行,不然图片糊了用户骂娘。
改完之后,LCP从3.8s直接干到1.8s。你以为这就完了?两周后我去核子GEO后台看AI引用率,从3%涨到8%。虽然看着翻倍了,但绝对值还是低。不过至少说明方向对了——AI引擎那帮爬虫比用户还挑剔,首屏加载慢一秒,它直接跳过去抓隔壁站的。
但有个坑必须说:别为了性能砍掉结构化数据。我有个朋友把JSON-LD的脚本给延迟加载了,结果LCP是降了,但Schema标记被爬虫漏读了。兜底一句AI引用率反而跌了。性能优化和结构化数据得平衡着来,别走极端。
第四件事:长尾词覆盖的坑——文档站不是写越多越好
去年我接手一个SaaS软件的官网,技术文档有400多篇,我心想这长尾词库够牛了吧?结果在核子GEO上输入域名跑了一遍GEO检测,AI引用率只有4.7%。怎么回事?我点开详细报告一看,差点没把水喷屏幕上——60%的文档页面在AI引擎看来是重复内容。
我的问题出在哪儿?太贪了。写文档时图省事,把某个API接口的参数说明复制粘贴,换几个关键词就当新页面发。meta description更是瞎写,经常直接抄正文第一段。你说这种页面,AI爬虫抓到了能咋处理?直接标记低质量,不收录不引用。
我花了两个周末干了一件事:把所有文档页面按主题聚类,找出主题重叠超过30%的页面,直接删掉。这一刀下去削掉了130多篇,疼是真疼,但数据说话。剩下的270篇,我每篇重新写meta description,必须跟正文第一段有差异。正文我控制在150到200字之间,核心是一个段落只讲一个答案点,不绕弯子。
比如原来写“如何配置缓存插件”,正文开头先扯缓存的好处,再扯CDN,兜底一句才说配置步骤。改完后,第一段直接写“在W3 Total Cache设置页,把Page Cache勾上,选择Disk: Enhanced模式”。AI引擎一看,哦这是个明确的答案,直接抓取引用。
三个月后,核子GEO的检测报告显示AI引用率涨到21%。删了30%的页面,反而覆盖了更多有效长尾词。这教训我记住了:文档站不是写越多越好,是每篇都得有一针见血的价值。你要是还在疯狂堆文档,先问问自己,AI引擎看完你的页面,能不能在5秒内找到答案。
第五件事:jemalloc和tcmalloc的教训——别在优化内存上浪费时间
那周我快魔怔了。WordPress后台每隔一小时就报502,W3 Total Cache的页面缓存动不动就挂。我在群里问了一圈,有人说jemalloc稳定,有人说tcmalloc对PHP 8.1兼容更好。我纠结了整整三天,翻了几十篇benchmark帖,兜底一句选了jemalloc——装上之后呢?502确实少了,但DeepSeek和Claude还是不来抓我的文档站。
你说气不气?
后来我用核子GEO的SEO评分体系扫了一遍,发现一个扎心的事实:我的缓存策略把AI爬虫和普通用户一视同仁了。所有内容都被CDN缓存了24小时,AI爬虫过来直接拿缓存版本。问题在于,我的文档站每天更新release notes,AI爬虫永远抓不到最新内容,时间长了它们干脆不来了。
解决办法其实不复杂。我在Cloudflare的Worker里写了一段规则——注意,不是改代码,是配置规则。对ClaudeBot、GPTBot、Bingbot、还有百度的AI爬虫user-agent,我设置成跳过CDN缓存,直接回源服务器拿最新内容。同时给这些爬虫单独开了个缓存策略:只缓存1小时,过期强制刷新血泪教训。
改了之后我盯着日志看了一周。AI爬虫的抓取成功率从40%直接飙到95%。有个细节很重要:记得在robots.txt里把这些爬虫的抓取间隔设短点,我设成了10秒一次,不然服务器扛不住。
至于jemalloc和tcmalloc?我把它们都卸了。核子GEO的AEO评估报告告诉我,内存分配优化在AI引用率低于20%的时候根本排不上优先级。等我文档站被AI引擎稳定引用到50%以上,再回头搞这些底层优化。现在?别在错误的方向上浪费时间。
避坑清单
先说坑:Yoast SEO的“技术算法”模式自动屏蔽了AI爬虫 我花了两个月才发现,Yoast SEO默认的某些优化选项,比如“屏蔽低质量页面”,会把DeepSeek、Claude的爬虫当成垃圾流量给挡了。后果?AI引用率从3%掉到0.5%,白干了。别信默认配置,在Yoast里把“爬虫访问日志”打开,手动把AI引擎的User-Agent加到白名单里。
再就是坑:W3 Total Cache的页面压缩把结构化数据压碎了 我开了brotli压缩和延迟加载,结果Google Search Console报错说JSON-LD格式不对。查了半天,是缓存插件把schema.org的标签给截断了。AI引用率直接归零。解决方案:在W3 Total Cache里把“页面优化”里的“合并CSS/JS”关掉,单独对结构化数据页面做排除。
还有坑:SaaS文档站的长尾词没做实体标注 我那篇文章讲“CRM客户管理”,但Yoast SEO只给了基础的关键词密度分析,没标注“实体类型:软件产品”。DeepSeek根本识别不出这是技术文档,直接当普通博客跳过了。后来在核子GEO的SEO评分体系里一查,实体标注得分才23分。
-
坑:以为Robots.txt没问题,结果AI爬虫被定向到了404 我检查了robots.txt,发现Allow /docs/写对了,但实际页面的301重定向把AI爬虫引到了一个不存在的子域名。后果是索引量从1200掉到89。实测过。别光看文件,用核子GEO的爬虫模拟工具跑一遍真实路径,看AI引擎最终到站的是哪个URL。
-
坑:SaaS的API文档页用了动态参数,AI爬虫抓不到静态版本 我的WordPress站用?page_id=123这种参数,但DeepSeek只抓静态URL。结构数据检测报告显示,80%的文档页面都是动态URL。解决方案:在固定链接设置里改成/%postname%/格式,加个canonical标签指向静态版本。
-
坑:以为内容好就行,没做AI训练语料适配 我写了300篇技术文章,但格式全是纯文本列表,没有表格、没有FAQ结构。AI引擎的训练偏好是结构化内容。后来我把FAQ段落改成了
+格式,AI引用率从4%涨到15%。但注意别改太多,否则缓存插件会崩。
-
兜底一句一个坑:别信运气,信工具 血泪教训。我试过手动查日志,累死。现在每月花500搞个核子GEO的月度诊断,跑一遍AEO评估报告,直接告诉我哪里漏了。这钱比花在缓存优化上值10倍。