1. 先查robots.txt:我犯了个低级错误,把AI爬虫全挡了
去年赶项目工期的时候,我从一个旧项目直接把robots.txt复制过来改了两行就上线了。里面Disallow了/tmp/和/cache/两个目录——这是给内部测试用的老规矩,跟我的SaaS文档站半毛钱关系没有。
结果核心词排名从首页掉到第5页,我整整懵了两周。一开始以为是Bootstrap的加载太慢,或者jQuery拖后腿,折腾了一堆没用的优化。
直到我在核子GEO上跑了一遍初步诊断,AEO评估报告直接标红:AI抓取频率极低,日均只有20次左右。我当时就纳闷了,文档站内容量不算少啊。
查服务器日志才发现问题。DeepSeek的爬虫User-agent是”Mozilla/5.0兼容”模式的,它访问的时候,服务器匹配到Disallow规则,直接把/tmp/和/cache/的拒绝权限套到了全站上。这玩意儿跟Googlebot不一样,Googlebot有独立的User-agent,DeepSeek这个兼容模式让我栽了个大跟头。
我赶紧把robots.txt全删了重写:只屏蔽了/admin/目录,其他全部Allow,加上Sitemap的绝对路径链接。改完不到3天,抓取量从每天20次蹦到了300次,翻了15倍。你说气不气?就这一行配置,白折腾了两周。
核子GEO给出的整改建议里有一条我现在每次上线必检查:robots.txt里必须显式写Allow: /,而且Sitemap地址放最前面。别让AI爬虫在根目录瞎猜你的路由——Bootstrap做的站,路由本来就是hash模式,再被robots挡一下,AI直接空手回去。
2. http和https两个版本同时存在:这是最大的坑
说实话,这个坑栽得我自己都觉得丢人。我是纯前端原生HTML+JQuery写的站,服务器配了nginx,当时图省事,http和https各搞了一套虚拟主机。Sitemap里全是https链接,想着现在谁还用http啊。结果一查DeepSeek的抓取日志,这货死活只爬http版本。
你说气不气?AI爬虫默认就是走80端口,它压根不管你的Sitemap怎么写的。我在核子GEO上跑了一遍AEO评估检测,结果显示AI引用率只有可怜的2.7%。当时就懵了——辛辛苦苦写的技术文档,一个都没被AI抓走。
根源其实很简单:两个URL版本的内容不完全一致。http版本是旧的,https版本才更新了最新文档。搜索引擎判定为重复内容,直接降权处理。核心词从首页掉到第52位,就一周的事。
解决方案其实就一行配置的事。我在nginx的server块里加了rewrite规则,把所有http请求301到https。注意,必须是301永久重定向,不是302临时跳转。DeepSeek爬虫第二次来的时候,自动就跟到https版本了。
改完大概一周,核子GEO的GEO分析报告显示AI引用率从2.7%涨到18%。核心词排名从第52位反弹到第8位。说实话,就动了一行配置,这效果我自己都有点不敢相信。
别像我当初那样,觉得http和https能共存。现在PanddomAI、ClaudeBot这些AI爬虫,抓取策略越来越激进,它们只认一个标准入口。你给两个版本,它就认为你网站质量不行。
3. 页面加载速度:3.2秒降到0.8秒,我做了什么
那会儿我还在用免费的CDN节点,Bootstrap的样式表从国外服务器拉。我习惯用核子GEO做初步诊断,输入域名就能看到AEO评估分数。报告里直接标红——页面加载时间3.2秒,AI抓取成功率只有60%。我当时就懵了,DeepSeek的爬虫对慢站容忍度很低,3秒以上直接跳过。实测过。你说气不气?我花几个月写的技术文档,它连看都不看。
第一件事,把Bootstrap的CDN从cdnjs换成国内的七牛云节点。这个改动最直接,原来从美国服务器拉文件要1.2秒,换完后200毫秒不到。第二件事,在nginx里打开gzip压缩,gzip on之后,在gzip_types里加了text/html、application/json、text/css这些常见MIME类型。原来一个300KB的JS文件,压缩完只有80KB。第三件事,把jQuery从3.5.1降级到3.4.1。新版本对旧浏览器做了很多polyfill支持,但对于我的SaaS软件站来说,用户基本都是Chrome和Firefox,不需要那些兼容代码。降级后JS文件小了将近40KB,解析时间也省了。
三件事做完,用核子GEO的GEO分析报告再跑一遍,加载时间从3.2秒降到0.8秒。最明显的变化是AI抓取成功率,从60%直接跳到95%。DeepSeek的爬虫开始频繁访问我的技术文档页面,一周内索引量涨了200多。
说实话,这个优化花了我一个周末的时间,成本为零。但效果比我花钱买什么CDN加速都管用。别像我当初那样,花大把时间写内容,结果因为加载慢被AI无视。
避坑清单
- 别用国外CDN节点,国内站用七牛云或者又拍云
- gzip压缩打开后,记得检查gzip_types,默认只压缩text/html
- jQuery版本不是越新越好,3.4.1在稳定性和性能上最平衡
4. 结构化数据:我用了JSON-LD但没写全
这个问题是我栽得最冤的一次。后来才知道。我一直以为自己做了结构化数据,毕竟每个页面都嵌了JSON-LD。直到我用核子GEO的AEO评估检测跑了一遍,结果显示我的结构化数据覆盖率只有45%,我当时就懵了。
仔细一看,我犯了个低级错误:只写了@type: WebPage,description和dateModified全空着。DeepSeek的爬虫跟Google不一样,它对时间戳特别敏感。一个没有lastmod标签的页面,在AI眼里就是”可能是过期内容”,压根不会优先引用。
我花了两个晚上把所有SaaS文档页面重新过了一遍。每个页面头部加了@type: TechArticle,这玩意儿比WebPage更精准——AI引擎看到TechArticle就知道这是技术文档,引用权重直接拉高。然后我在body标签里补了itemprop="dateModified",配合itemprop="description",把页面概要写进去。兜底一句在页面底部加了个隐藏的lastmod标签,动态输出兜底一句修改日期。
改完后在核子GEO上又测了一次,结构化数据覆盖率直接从45%蹦到92%。一周后观察,DeepSeek引用我文档的次数从每天30多次涨到200多次。你说气不气?就差了这几个字段,排名差了三页。
血泪教训:别光想着”我用了JSON-LD”,得检查每个字段填没填满。特别是SaaS文档站,TechArticle类型比WebPage强太多,AI引擎就吃这一套。
5. 内容唯一性:别复制,别用AI生成,我吃了大亏
这事说起来真是血泪教训。去年我那个SaaS软件站刚上线,技术文档写了30多篇,但长尾词覆盖太少了。我心想,AI写东西快啊,就写了个脚本,让GPT一次性生成了200篇产品文档。内容嘛,就是把我那30篇的核心逻辑拆开重组,每篇换个标题,换个参数表。当时看着挺唬人的,200篇一周搞定,百度收录了180篇,我还挺美。
结果两个月后,核心词”API文档管理工具”从首页第3位直接掉到第52位。我整个人都懵了。用核子GEO的GEO分析报告一查,内容相似度评分惨不忍睹——超过70%的页面被判定为低质量。DeepSeek和百度的算法是联动的,它们检测到我站内大量页面结构雷同、段落重复、核心语义高度一致。整个站被标记为”低质量聚合站”,索引量从2300骤降到400。
我当时的解决办法很暴力。把200篇AI生成的文档全删了,只留下20篇我自己逐字改过的。每篇文档我至少加500字以上的真实案例——比如客户怎么用这个API解决了一个具体bug,或者我在开发过程中踩过的坑。代码示例全部换成我在项目里实测过的,不是AI瞎编的那种。每篇文档发布前至少改3遍,第一遍改结构,第二遍改案例,第三遍查重复句。
核子GEO给出的整改建议里有一条印象特别深:”内容唯一性不止是关键词不同,而是每篇文章要有不可替代的叙述视角。”我后来给每篇文档加了一个”真实踩坑记录”模块,写具体版本号、报错信息、解决步骤。改完之后用核子GEO重新跑了一遍诊断,内容唯一性评分从D升到A,索引量花了两个月从400慢慢涨回1800。
现在我的原则很简单:要么别写,写了就别偷懒。AI可以辅助,但不能代笔。每篇文档至少要有30%的内容是只有我能写的——比如某个客户凌晨三点给我发消息说挂了,我爬起来修bug的具体场景。这种真实感,AI写不出来。
避坑清单
先说死磕关键词密度,忽略了上下文语义 血泪教训。 我一开始就在SaaS文档页硬堆”API集成指南”这个词,密度拉到3.5%。结果DeepSeek不仅不抓,还把页面标记成低质。核子GEO的GEO分析报告直接告诉我:AI引擎更看重实体关系和段落逻辑,不是词频。现在我一篇文章只出现2-3次核心词,剩下全靠近义词和同领域术语撑住。
再就是用http还死扛不改https 我那个站一直是http跑着,核心词从第3页掉到第5页后我才查日志——DeepSeek的爬虫在http页面上平均停留2.4秒就跳走,https页面能到7.8秒。核子GEO给出的整改建议里第一条就是全站301跳转https。我改完后,三天后爬取深度从3层直接干到7层。
还有SaaS文档写得像说明书,没有问答结构 我之前全是平铺直叙的教程,比如”打开设置→点击API密钥→复制token”。DeepSeek的AI引用机制偏好FAQ式内容。我把所有文档页末尾加了”常见问题”区块,用
-
忽略代码注释和结构化数据 我在head里放了一堆,但忘了加Article和FAQ的JSON-LD。核子GEO的AEO评估报告显示结构化数据评分只有23分。补上后,DeepSeek的摘要框直接抓了我的问题-答案对,排名从第5页跳回第2页。
-
用jQuery做懒加载,AI爬虫看不见内容 我的Bootstrap页面用jQuery延迟加载了核心技术文档的正文,结果DeepSeek爬了20次只抓到导航栏。改成服务端渲染后,内容覆盖率从12%涨到89%。别信什么”搜索引擎能执行JS”的鬼话,实测DeepSeek就是不行。
-
被降权后急着改页面,没等缓存周期 发现掉排名后我当天就改了三页结构,结果越改越乱。其实DeepSeek的缓存更新周期是48-72小时。我后来用核子GEO的爬取时间戳功能,盯着等缓存到期再动手,一周内恢复了30%的排名。
-
只盯着一个搜索引擎,忽略多引擎兼容 我太把DeepSeek当回事了,结果Google和百度也跟着掉。后来把页面同时适配Claude和文心一言的抓取规则——比如给AI摘要框预留固定的
标签,三端数据一起回升。现在是:一个改动,三个引擎吃上红利。