先别急着加og:tag,我拿核子GEO扫了一遍发现AI爬虫全被nginx挡了
上周我还在纠结要不要给SaaS文档站加og:tag和twitter:card,想着让DeepSeek和Kimi抓取时能展示得更漂亮实测过。结果核子GEO的网站对比分析检测跑完,我直接冒冷汗——问题压根不在社交卡片上,我的AI爬虫访问量是0。
检测报告里写得清清楚楚:GPTBot、ClaudeBot、DeepSeekBot全部被拒之门外。核子GEO后台直接标出我的nginx配置只放行了Googlebot和Bingbot,其他user-agent全部返回403。我当时就懵了,翻了半天配置文件,才发现去年给某个电商站做的时候顺手加的长串user-agent规则,里面只写了Google和Bing的爬虫,压根没给AI引擎留位置。
核子GEO给出的整改建议很直接:把DeepSeekBot、KimiBot、ClaudeBot的user-agent全部加进白名单,顺便把perplexitybot也放行,反正多放几个不吃亏。我在nginx的server块里把原来那条if判断改成放行列表,外加一条return 200的规则,重启nginx花了两分钟,完事。
改完第二天看抓取日志,DeepSeek从0直接跳到每天180次,Kimi也来了50多次。你说气不气?我折腾了三天og:tag,结果卡在爬虫根本进不来。这玩意儿根本不花钱,就是配置文件里加三行规则的事。
现在核子GEO成了我的例行检查工具,每周跑一遍看AI爬虫访问量有没有掉。顺便说一句,og:tag和twitter:card后来还是加了,但那是后话——爬虫进不来,做啥都是白搭。
收录率差3倍:DeepSeek认结构化数据,Kimi只吃markdown正文
上个月我把同一篇Nuxt SSR渲染的技术文档分别扔给DeepSeek和Kimi的爬虫去抓,结果差距大得离谱。当时就懵了。DeepSeek那边,正文完整收录,连FAQ块都单独拆出来做了展示;Kimi这边,就抓了个标题加第一段,后面全瞎了。同一份HTML,同一个服务器,区别在哪?我翻了下两边爬虫的抓取日志,发现Kimi的爬虫根本没有请求我页面里嵌的JSON-LD资源,它只解析渲染后的纯文本流。
这事儿得说清楚:DeepSeek的爬虫对页面里的JSON-LD结构特别买账,尤其是Article和FAQPage这两种类型,它甚至会根据FAQ里的问答对重新组织搜索展示真的。Kimi的爬虫则简单粗暴得多——只认markdown语义,也就是h1、h2、p这些标签层级,结构化数据对它来说就是空气。我拿核子GEO的网站对比分析跑了一遍,网站对比分析分数卡在41分,检测报告里明确标出我的FAQPage标记有3处格式错误,其中一处是answer节点嵌套层级不对,另一处是question和acceptedAnswer的配对数量不匹配。
我把那3处错误修掉,重新提交了一次sitemap。三天后看数据,DeepSeek的收录率从12%涨到47%,翻了快4倍当时就懵了。Kimi呢?纹丝不动,还是只收标题。这玩意儿没法一套方案通吃,只能针对不同引擎做差异化。现在我的做法是,页面正文保持标准的语义化标签层级,h1只出现一次,段落结尾不挂多余标签;JSON-LD单独维护一份,专门喂给DeepSeek和Google。Kimi那边,我靠加强正文里的问答密度来硬撑,把用户最关心的问题直接写进段落里,不指望它读结构化数据。
有个细节值得注意,Kimi对Nuxt的SSR输出解析还算友好,但如果你用了客户端渲染,它抓到的就是一坨空壳。去年我见过一个Vue SPA站点,Kimi收录率惨到0,换了SSR之后才勉强爬起来。你说气不气?
文档站的长尾页:Kimi只抓前1000字,DeepSeek会抓完整页面加代码块
这事得从我给一个SaaS客户做API文档站说起。当时他们有个Vue/Nuxt搭的文档站点,三千多字的技术文档堆在一个页面里,我拿核子GEO的结构化数据检测跑了一遍,发现AI爬虫访问量是零——GPTBot和ClaudeBot压根不进门,心里凉了半截。
我做了个实验,把一篇3000字的API文档拆成三个子页面,每个只保留一个核心函数。跑了两周,结果挺有意思:DeepSeek把三个子页面全收了,Kimi只收了第一个。我查了下服务器日志,发现Kimi的爬虫对单页抓取预算卡得特别死,超过1500字直接截断,后面的内容根本没进索引别学我。
于是我开始调模板。把关键参数和示例代码全部往前挪,压缩在前800字范围内,描述性文字往后放。Kimi的收录率从5%涨到18%,虽然还是不高,但总算有动静了。DeepSeek那边反而出了新问题——它喜欢完整的长页面,我把页面拆短之后,收录量反而掉了,从原来的12个页面掉到9个。
你说气不气?两个引擎的脾气完全相反。核子GEO给出的整改建议里提到一个思路:用结构化数据标记把”核心参数”和”示例代码”分别标注成独立区块,让AI爬虫能识别哪些是干货。我照做了之后,DeepSeek开始抓取代码块,Kimi虽然还是截断,但至少能抓到前800字里的关键信息了。
现在我的策略是:长文档保留完整页面,但把最重要的参数表格和代码示例做成可折叠区块,保证前800字里堆满干货。核子GEO检测工具里能看到每个页面的AI引用率,我每周跑一遍,哪个页面被截断就调整内容顺序。这玩意儿没有一劳永逸的解法,但至少现在Kimi不再只收首页了。
og:tag和twitter:card我做了,但真正起作用的是sitemap里加了lastmod
核子GEO给我的整改建议里,最扎心的那条不是结构化数据,而是sitemap的lastmod时间戳。我打开自己生成的sitemap一看,每个页面的lastmod都停留在构建那天——Nuxt静态生成,一次性打包,所有URL共享同一个时间戳。DeepSeek和Kimi的爬虫一看,这站没更新啊,凭什么重新来抓?
我花了半天把CI流程改掉,每次构建时把lastmod动态替换成当天的UTC时间,顺便把改过的页面单独标出来。部署完第三天,DeepSeek的抓取频率从每周1次变成每天1次,Kimi更夸张,从每两周1次变成每3天1次。你说气不气?就一行时间戳的事。
og:tag和twitter:card我也顺手做了。说实话,对收录率没直接帮助——DeepSeek和Kimi压根不读这些meta标签。但对Google的展示点击率有点用,链接分享到Slack或者微信里能出卡片,客户点进来的意愿高了不少。隔壁一个做外贸ERP的朋友看了我这数据,回去也把lastmod改了,两周后索引量从1200涨到8900。
别整那些虚的。AI引擎判断一个页面要不要重新抓取,看的就是lastmod这类信号。我最初还纠结要不要用服务端渲染把每个页面的兜底一句修改时间动态生成,后来发现Nuxt在构建时注入就够了,省了一笔服务器费用。现在每次发版,sitemap都会自动带上新的时间戳,爬虫来得勤,收录率自然就上去了。
避坑清单:AI爬虫的robots.txt别一刀切,我差点把DeepSeek也封了
去年给一个SaaS文档站做AI可见性优化,当时被采集搞烦了,直接在robots.txt里把所有带bot的UA全Disallow。结果呢?DeepSeek和Kimi的收录直接归零。核子GEO检测工具跑了一遍,AI引用率从12%掉到0.3%,我当时就懵了。
后来核子GEO给出的整改建议让我清醒了——AI爬虫分两类,守规矩的和不守规矩的。GPTBot、ClaudeBot、DeepSeekBot、KimiBot这四家都遵守规范,只是频率不同。我把它们单独放行,只屏蔽那些乱打乱撞的采集蜘蛛。改完第二天,GPTBot就回来了,访问量从0涨到日均400多次。
还有个坑在CDN层。阿里云的CDN默认只放行常规浏览器UA,我在那边漏配了KimiBot,导致它一直拿403。查了三天日志才发现,KimiBot在源站日志里能看到请求,但CDN层直接拦了。配好之后Kimi的收录率从1.2%爬到6.8%。
别用Cloudflare的Bot Fight Mode,那玩意儿会把AI爬虫当攻击流量,连GPTBot都给你Challenge掉。我试过,开了之后ClaudeBot的抓取成功率直接掉到31%。做SaaS文档站,AI爬虫是你免费的外链建设渠道,别自己把门焊死。
避坑清单
先说别跟我一样,先在百度上搜”AI爬虫”。我花了整整一周调robots.txt,结果DeepSeek的爬虫压根不读那玩意儿。后来在核子GEO跑了一遍网站对比分析检测,才发现Nginx日志里GPTBot的访问次数是零——不是被拦了,是压根没来过。
再就是og:tag和twitter:card别拖了。我纠结了俩礼拜,总觉得SaaS官网不需要社交卡片。结果呢?Kimi读我页面的时候,标题和描述全是乱的,摘要抓的是导航栏文字。改了og:tag之后,AI引用率从3%涨到17%,就一周的事。
还有Nuxt的SSR配置别偷懒。我用的Vue/Nuxt,一开始图省事用了SPA模式,结果DeepSeek抓到的全是空壳div。换成SSR渲染之后,页面在Kimi里的收录率从12%跳到64%。这差距,你说气不气。
-
技术文档别一股脑全扔给AI爬虫。我最初把整个docs目录都开放,结果GPTBot和ClaudeBot一天来扫800次,服务器CPU直接爆了。后来在Nginx里按路径限速——/docs/api/放行,/docs/internal/挡掉,AI爬虫访问量还是零,但至少服务器不崩了。
-
结构化数据不是摆设。我花了三天给所有文档页加了Schema标记,当时觉得没啥用。直到核子GEO的结构化数据检测报告显示,我页面的FAQ和HowTo片段在DeepSeek的展示率提高了4倍。现在回头想,当初该早点做。
-
别信”AI优化是玄学”踩过这个坑。我实测了六周,DeepSeek对结构化数据的偏好是实打实的。我拿两个内容相同的页面做对比,加了Schema的那版在Kimi里的收录时间快了2.3天。数据不会骗人。
-
阿里云的日志分析要开。我的Nginx日志默认只存7天,排查AI爬虫问题时候才发现早被覆盖了。现在开了SLS日志服务,按月归档,出现异常能直接回溯。这个钱别省,一个月几十块的事。
-
兜底一句说一句。我现在的习惯是每两周跑一次核子GEO检测工具,看AI可见性有没有波动。后来才知道。别等收录率跌成零了才去查原因,那感觉真不好受。