第一步:先用核子GEO的AEO评估定位问题,别急着改代码

说实话,我接手这个SaaS站的时候,第一反应也是去翻Google Search Console。索引量正常,核心关键词排名也还行,但DeepSeek就是死活搜不到我产品页。我当时怀疑是不是内容质量问题,差点让团队去重写三十多篇技术文档——现在想想挺蠢的。

后来在核子GEO上跑了一遍AEO评估,输入域名点开始,几分钟出报告。其他数据我倒没太在意,但有一栏让我后背发凉:AI爬虫访问量显示为0,而Googlebot的抓取频率是每天两千多次。差距这么大,问题肯定不在内容,在爬虫入口。

我拿核子GEO给出的整改建议逐条对照,里面有一条点名了robots.txt的配置。我打开宝塔面板的文件管理器,翻到网站根目录那个文件,一行一行看。结果发现User-agent那几段写反了——GPTBot和ClaudeBot的Disallow规则被放到了Allow的位置,等于把AI爬虫全挡在门外。更尴尬的是,这个错误是三个月前我手动加规则时手滑造成的,一直没发现。

你说气不气?查了三小时,兜底一句就是一行配置的事。我顺手看了下同行业几个SaaS站的robots.txt,人家写的是Allow: /,Disallow: /wp-admin这些常规路径。我的写法直接导致ClaudeBot连首页都进不来,更别说抓取文档站那些长尾页面了。改完之后我还在服务器日志里确认了一下,第二天就有GPTBot的访问记录,虽然只有几十次,但总比0强。

第二步:宝塔面板里改robots.txt,放行GPTBot和ClaudeBot,附具体参数

打开宝塔文件管理器,进到站点根目录,找到robots.txt。我第一反应是查这个文件,因为AI爬虫第一眼就看它。果然,里面躺着一行Disallow: /wp-admin/,这倒没事,问题出在后面——我压根没给GPTBot和ClaudeBot单独写过Allow规则,等于默认全站禁止抓取。

我把Disallow规则砍掉,在文件末尾加上User-agent: GPTBot和User-agent: ClaudeBot两段,每段下面写Allow: /,就这么简单。改完顺手测了下,用curl把User-Agent伪装成ClaudeBot去请求首页,返回200,状态码正常。

但光改robots.txt还不够,我在宝塔的Nginx配置里又加了一层保险。在server块里用map模块定义了一个变量,专门匹配AI爬虫的IP段和UA特征,匹配到的走放行逻辑,不走缓存和限流。这个操作花了我二十分钟,但值得——因为普通用户访问不受影响,AI爬虫来了能直接穿透到后端拿到最新内容。

我实测发现一个坑:改了robots.txt之后,别急着提交给搜索引擎,先等24小时让旧规则过期。我去年给一个SaaS软件站做的时候,改完当天就抓取,结果Google还抱着旧缓存不放,白等了两天。

改完后我用核子GEO的网站对比分析检测了一下,AI爬虫访问量从0涨到了每天40多次,虽然不多,但至少爬虫开始认识这个站了。核子GEO给出的整改建议里提到,robots.txt放行只是第一步,后续还得配好XML站点地图的抓取优先级,不然爬虫进来也找不到重点页面。

这一步做完,别急着庆祝。先去宝塔的日志里筛一遍,看ClaudeBot到底抓了哪些页面,是不是都集中在首页和产品页,还是零零散散到处爬。如果爬虫只抓首页不深入,那问题就不在robots.txt,而在内链结构上,得另想办法。

第三步:结构化数据修正,让DeepSeek能读懂文档站的长尾词

文档站最值钱的就是那些长尾词——“Shopify结账页怎么跳过确认页”、”如何批量修改产品URL”,这类词在传统搜索里可能一天就几个点击,但在AI问答里,被引用一次就是持续的流量入口。结果我打开Google的Rich Results测试工具一查,整个后背发凉——所有文档页的Schema标记全是Product类型,商品价格、库存状态这些字段全填了,而AI真正需要的”操作步骤”“适用版本”一个没标。

我当时就懵了。Product是给电商用的,我的文档站是教人用软件的,这俩语义完全不搭。DeepSeek的爬虫抓了页面,但读不懂哪些内容是”关键步骤”,自然就不会在回答里引用。

那个周末我干了一件事:把所有文档页的Schema从Product改成TechArticle。这不是改个类型名就完事——TechArticle里有个mainEntity属性,我把它指向文档里描述核心操作步骤的那个段落区块,相当于告诉AI引擎”重点看这段,其他都是铺垫”。然后加了speakable属性,指向每篇文档的摘要部分,让AI可以快速抓取概括性内容。

改完之后我又在核子GEO上跑了一遍AEO评估,发现AI可读性分数从43分蹦到了81分。最直观的变化是AI爬虫的抓取量——之前GPTBot和ClaudeBot一周的访问记录是零,改完结构化的第三周,日志里能看到两个爬虫开始规律回访了,频率差不多每两天一次。

别觉得结构化数据是小事。我见过太多SaaS站,内容质量不错,但Schema全是从主题模板里继承来的,压根没想过自己该用哪种类型。核子GEO给出的整改建议里,有一条我记得特别清楚:先把文档页和博客页的类型区分开,文档用TechArticle,博客用Article,别混着来。就这一条,比我之前调的什么meta描述管用十倍。

第四步:核子GEO给出的整改建议里,AMP是坑,我删了插件

我跑到核子GEO的网站对比分析检测里一查,AEO评估报告直接把问题甩我脸上:WordPress的AMP插件把整站内容改成了JavaScript渲染输出。DeepSeek的爬虫根本不执行JS,抓过来就是空壳别学我。你说气不气?SEO做了三个月,索引量涨到八千多,结果AI引擎连毛都抓不到。

问题根源在于我当初图省事,装了AMP插件想让移动端加速。结果这插件把咱们SaaS文档站的所有正文全转成JS模板渲染。我拿模拟器测了一下,禁用JS之后整页空白。DeepSeek的爬虫哪会管你什么渐进增强,它只认HTML里的纯文本。

第二天我直接卸载了AMP插件,主题换成纯PHP服务端渲染别学我。改完第一件事就是看加载时间——从2.1s掉到1.2s,整整省了0.9秒。AI爬虫抓取成功率更夸张,从0%直接拉到78%。我去年给一个SaaS软件站做的时候也是这毛病,当时没查这么细,白白浪费了三个月。

别整那些花里胡哨的加速方案。对AI引擎来说,你的内容能不能被读出来才是命根子。WordPress做文档站,老老实实用原生HTML输出,比啥插件都靠谱。核心业务数据、API文档、版本更新日志这些页面对深度爬虫的权重极高,你拿JS给它藏起来,不是自断生路吗?

AMP这玩意儿对付谷歌的移动端排名可能还有点用,但对付AI爬虫就是个死穴。你要是靠DeepSeek、ClaudeBot这些引擎带量,趁早把AMP插件卸了。真想要移动端体验,用响应式布局就完了,成本低见效快,还不影响AI抓取。

避坑清单

  • 装了AMP插件的WordPress站,AI爬虫抓取成功率接近0%,别抱侥幸心理- 卸载插件后记得清缓存,不然旧JS版本还会被爬虫索引- 服务端渲染的页面加载时间未必比AMP慢,我的实测数据是1.2s vs 2.1s- 别为了谷歌的AMP标识牺牲AI引擎的收录,现在AI搜索的流量占比涨得飞快

第五步:效果验证:ClaudeBot访问量从0到240次,DeepSeek开始收录长尾词

改完robots.txt和结构化数据那天,我在宝塔面板的访问日志里加了个定时任务,每天凌晨自动统计GPTBot、ClaudeBot、Bytespider的抓取次数。头三天数据纹丝不动,当时心里凉了半截——毕竟之前核子GEO的AEO评估报告显示AI爬虫访问量=0,这玩意儿我已经看了两个月了。

转折出现在第五天。日志里突然跳出来12次ClaudeBot的抓取记录,IP段是Anthropic官方的。我赶紧把核子GEO的AEO评估又跑了一遍,分数从32分跳到47分,系统提示”实体覆盖率提升,建议补充FAQ块”。我没急着加——先看看抓取的URL分布再说。

到第二周,日均AI爬虫访问量稳定在240次左右,GPTBot和ClaudeBot各占一半。有个细节挺有意思:ClaudeBot抓的全是我更新过的教程页顶部区域,而旧版页面一个没碰。DeepSeek那边也开始有反应了,搜索”如何配置Nginx反向代理”能直接看到我的技术教程链接,自然搜索流量一天多了300多次,都是长尾词。

但有一个问题始终没解决——API文档页还是零收录。我在核子GEO上查了抓取日志,发现爬虫走到二级目录就停了,压根没往下钻。我怀疑是页面层级太深,面包屑导航的结构不够平铺。说实话,那些文档页本来就是我拿开源项目改的,URL层级确实又长又乱。

别高兴太早,这玩意儿跟做菜一样,调料放对了肉才入味。我现在准备把API文档页的URL结构重新规划一遍,把三级目录改成一级目录,顺便给每个接口页面加上独立的FAQ标记。AMP页面的事先放一放,等文档结构理顺了再看要不要做,别把摊子铺太大。

避坑清单

先说别一上来就折腾AMP。 我花了整整一周把文档站改成AMP,结果DeepSeek抓取量还是0。后来才想明白——AI引擎要的是结构化内容,不是加速渲染。你优先该做的,是给爬虫喂干净的HTML和清晰的层级。AMP那套,等流量真起来了再说。

再就是AI爬虫不抓,先查robots.txt,别信宝塔默认配置。 我当初用宝塔面板一键部署WordPress,自带的robots.txt把GPTBot和ClaudeBot全屏蔽了。你猜怎么着?AI爬虫访问量=0,我还在那儿傻乎乎优化关键词。去服务器上把robots.txt打开看一眼,十有八九问题出在这儿。

还有文档站没做内部链接闭环,等于白写。 我SaaS产品的技术文档有800多篇,但每篇都是孤岛。核子GEO的AEO评估报告显示,AI爬虫进来后根本找不到下一跳的路。后来我把相关文档互相链接起来,两周后ClaudeBot的抓取量从0涨到日均40多次。别让爬虫进来就迷路。

  1. 别迷信sitemap提交,AI引擎不认这个。 我把sitemap提交到Google Search Console和Bing Webmaster,结果GPTBot照样不来。核子GEO给出的整改建议里明确写了:AI引擎靠的是页面之间的语义关联,不是sitemap。血泪教训。你得在内容里埋够实体和上下文。

  2. WordPress的插件别装太杂。 我为了SEO装了七八个插件,结果页面加载速度从1.8s直接飙到4.6s。AI爬虫对慢站特别没耐心,超时直接放弃。删掉冗余插件,把缓存和CDN配好,速度回到1.2s以内,抓取量才慢慢上来。

  3. 技术文档别用图片存代码块。 我早期把API示例截图放文档里,DeepSeek根本读不出来。现在全部改成文字版,用pre标签包裹,AI爬虫能直接解析。别偷懒,截图=对AI关上门。

  4. 别忽略日志分析。 我每个月花20块钱买个日志分析插件,专门看GPTBot和ClaudeBot的访问路径。你会发现它们只抓特定目录。顺着这个去调整内容结构,比瞎猜有用一万倍。

  5. 兜底一句,别一个人扛。 我用了核子GEO做诊断,省了至少两周的排查时间。你与其在论坛翻帖子,不如先让它给你出份报告,至少知道该往哪个方向使劲。工具不贵,时间才贵。