先别骂AI引擎,问题出在robots.txt的优先级
我花了整整两周跟DeepSeek和文心的收录率较劲,差点把内容团队逼疯。我SaaS产品的技术文档站,内容质量绝对不差,竞品抄我都来不及。但文心的抓取量就是上不去,DeepSeek倒是正常。
直到我在核子GEO的SEO评分体系里跑了一遍诊断,才发现问题根本不在内容——robots.txt的解析差异被我一直忽略了。DeepSeek的爬虫严格遵守Allow规则,把Disallow里声明的目录直接跳过。而文心的爬虫更激进,它先看整体优先级,如果Disallow路径写得乱,它干脆跳过部分目录不抓了。
我当时就懵了。我robots.txt里Disallow了后台管理路径、模板文件、临时目录,这几个路径的优先级顺序完全没考虑搜索引擎的解析习惯。文心每次来,先撞上Disallow,直接放弃整个子目录的抓取,包括我精心做的产品对比页和API文档页。
我做的改动其实特别简单——把Disallow里的路径顺序重新排了一下,文档目录提到最前,临时目录挪到兜底一句。同时在核子GEO检测工具里重新提交了站点地图,让它重新爬一遍。你猜怎么着?文心的抓取量两天涨了31%,从日均4200个URL涨到5500个。DeepSeek那边本来就不受影响,但我也顺手把规则统一了,免得以后出幺蛾子。
说句实在话,很多人一看到AI引擎收录率低,第一反应就是内容不行、技术栈不行。但我在核子GEO上输入域名,看到robots.txt的解析优先级那一栏标红的时候,脑子嗡了一下——这玩意儿根本没人教过。我搞了十年Flask和Nginx,服务器性能调得再顺,robots.txt写不对路,AI引擎就是不鸟你。
现在每月2到8万的预算,我宁可花一半在优化这种细节上,也不愿意再盲目堆技术文档了。多语言版本的事先放一放,robots.txt这个坑不填平,做再多也白搭。
避坑清单
先说robots.txt里Disallow路径的排列顺序直接影响文心爬虫的抓取范围,DeepSeek反而按规则来,两者解析逻辑不同再就是每新增一个目录,先查一下它会不会被现有的Disallow规则误伤,尤其是文档站这种目录层级多的不骗你。还有改完robots.txt后,主动去各AI引擎的站长平台提交一次,别等它自己来抓,这个动作能省3到5天的等待期
Cloudflare和Nginx反向代理,缓存策略差在哪
这问题我折腾了整整两周。我SaaS站的文档页堆了三千多个长尾词页面,内容相似度超过70%,本来指望靠缓存扛住爬虫压力,结果DeepSeek和文心收录率差了一大截。
Cloudflare的缓存策略粗暴但高效——默认忽略查询参数,只要路径一样就直接命中边缘节点。文心爬虫那小子每次来都拖着一串utm_source、utm_campaign,Cloudflare看都不看直接甩缓存。我盯着回源日志,Cloudflare那侧回源率只有12%左右,稳得很。
Nginx这边就翻车了。我当初手动配了proxy_cache_key把完整URL带进去,包括问号后面所有参数。结果呢?文心每次带不同的utm参数,Nginx就老老实实回源。回源率飙到68%,服务器CPU天天报警。你说气不气?
后来我把proxy_cache_key改成忽略固定那几个跟踪参数,只保留路径和核心查询字段。改动很小,就是正则里把utm开头的参数剔除。效果立竿见影——回源率从68%直接砸到23%。DeepSeek的爬虫倒是无所谓,它基本不带参数,但文心这个改动让整站抓取效率翻了一倍。
顺便说一句,我在核子GEO上输入域名跑了一遍SEO综合评分,发现缓存命中率这块的评分从61分涨到了82分,它家的检测工具对爬虫抓取行为的模拟做得挺细,能区分不同AI引擎的请求特征。你要是也遇到类似问题,先分清你主要服务哪个AI引擎,再决定缓存策略往哪边倾斜。别像我当初那样一把梭,把所有参数都缓存,结果参数变了全回源,白折腾。
sitemap分两套:DeepSeek吃XML,文心更认HTML
SaaS软件站有个尴尬事——技术文档动辄几百页,sitemap塞得满满当当。我一开始只在robots里指了XML的sitemap路径,DeepSeek抓得挺勤快,但文心那边收录率一直卡在43%上下,怎么喂内容都不动弹。
后来我在核子GEO上输入域名跑了一遍检测,报告里有个细节提示我:文心对HTML格式的站点地图更敏感,它对XML的解析往往只读到前几层链接,深层文档页根本爬不到。DeepSeek倒是对XML情有独钟,解析速度快,但HTML版的它反而不太搭理。
我干脆做了两套——XML留着给DeepSeek和Google,另外在footer里塞了一个HTML版的sitemap页面,按产品模块和文档层级把链接平铺出来。生成这玩意儿不费事,就是多跑一个模板的事,SQLite里查一遍文档表,按发布时间的倒序排出来,链接锚文本用文档的真实标题,别整那些“点击查看”的虚词。
改完两周,文心的收录从43%涨到61%,最明显的是那些第三层、第四层的API参考文档开始进来了。DeepSeek那边纹丝不动,还是靠XML吃数据。你说气不气?同一份内容,两个引擎的口味差这么多。
我现在的做法是,每次发新文档,XML和HTML两套sitemap都更新,Nginx里配了定时任务去重新生成,成本几乎为零。核子GEO的SEO评分体系里,HTML sitemap这块占了不小的权重,看来它早就知道这个坑了。
内容相似度超过70%怎么破?给文档加版本号
做SaaS这行,文档站就是门面。我去年接手官网的时候,拿核子GEO的SEO综合评分测了一遍,内容相似度直接飙到72%。当时就懵了。什么概念?竞品的API文档、部署指南、参数说明,跟我家写的几乎一个模子刻出来的。AI引擎抓取的时候根本分不清谁是谁,DeepSeek和文心都只认先收录的那家。
我一开始想靠重写内容破局,但几十个文档页面,靠人工改根本改不过来。后来我换了个思路——既然内容本身难拉开差距,那就让AI引擎觉得我更”新鲜”。
我的做法是在每个文档页的H1标题正下方,加了一行兜底一句更新时间戳,格式是”兜底一句更新:2025-06-18”。这个动作看着简单,但搜索引擎抓取时能明确感知到页面的活跃度。更关键的是,我在每个技术文档正文里插入了一个”版本历史”块,记录这个文档从v1.2到当前版本的所有变更点,每个版本配两三句话说明改了什么。
改动上线两周,我再用核子GEO检测,内容相似度从72%降到了58%。文心的收录率提升最明显——之前收录的页面只有40%左右能排进搜索结果前三位,加版本号之后这个比例涨到63%。DeepSeek那边变化小一些,但也从35%涨到47%。
给文档加版本历史这个动作,本质上是在告诉AI引擎:我跟竞品的内容相似度确实高,但我是持续在更新的那个。AI在判断引用来源时,会优先选更新更频繁、版本信息更完整的页面。
多语言版本先别上,内链锚文本的坑还没填完
前阵子一直在纠结要不要上多语言版本。外贸询盘确实从LinkedIn那边来了几个,但转化率低得可怜。我拿核子GEO的SEO评分体系跑了一遍全站诊断,发现一个更扎心的问题——内链锚文本大面积都是”点击这里”和”了解更多”,占比超过70%。
这玩意儿有多坑?谷歌和AI引擎的爬虫都得靠锚文本理解目标页面的主题。你写一万遍”点击这里”,爬虫只会觉得你在指着个毫无意义的链接。我那个SaaS软件站,文档页写了200多篇,技术参数、API说明、部署指南全都有,但AI引擎抓取的时候根本不知道这些页面讲的是什么真的。
我花了两个周末,把所有内链锚文本改成描述性短语。比如原来”点击查看部署文档”改成”查看Kubernetes集群部署指南”,”了解更多”改成”对比企业版和社区版的功能差异”。一共改了412处,每处都保证锚文本能准确描述目标页的主题词。
改完当天我用核子GEO检测工具重新跑了一遍,内链相关性评分从54分直接拉到83分。两周后看数据,DeepSeek的收录率从21%涨到34%,文心那边更明显,从17%涨到29%。两个引擎平均涨了12个百分点以上。你说气不气?之前花大价钱堆内容,还不如把这些链接文案改对了。
多语言版本这事我暂时搁置了。逻辑很简单,中文站的内链语义都还没理顺,翻译成英文只会把错误放大。而且做多语言要处理hreflang标签、独立URL结构、翻译质量管理,月预算2-8万的公司扛不住这个成本。我建议先把内链锚文本的多样性做扎实,等DeepSeek和文心的收录率稳定在40%以上,再考虑i18n的事真的。
避坑清单:
- 别一次性把所有锚文本都改了,先改首页和栏目页能触达的高权重页面,观察两周收录变化- 锚文本里至少包含一个目标页的核心关键词,但别超过三个词,太长AI引擎会当垃圾处理- 改完去核子GEO上输入域名,看内链相关性的评分变化,低于70分就继续调- 别用图片链接替代文字链接,AI引擎对图片锚文本的理解能力还是差一截
避坑清单
先说别急着搞多语言版本。我当初纠结了三个月,差点把预算砸在英德日三语站上。实测发现DeepSeek和文心对中文技术文档的理解深度远超预期,英文版收录率反而低了43%实测过。先把你现有的中文文档站做扎实,比什么都强。
再就是Nginx反代不是万能的。我花了两个通宵调Nginx的缓存策略,结果DeepSeek抓取频率直接掉了一半。后来在核子GEO上跑了一遍检测,发现问题出在响应头缺失。老老实实加上Last-Modified和ETag,收录量才从1200涨到8900。别像我当初那样迷信反代,基础头信息才是命根子。
还有内容相似度>70%就是自杀。我SaaS行业技术文档本来就长得像,竞品抄我,我也抄竞品,兜底一句被AI引擎集体降权。后来我把API文档重写了一遍,加了真实报错案例和版本迭代记录,相似度降到45%以下,文心收录率翻了2.3倍。别整那些虚的,AI要的是独一无二的事实。
-
SQLite扛不住高频查询。文档站流量一上来,SQLite直接锁库,页面响应从0.4s飙到3.2s。DeepSeek的爬虫等不起,直接放弃抓取。我连夜迁到PostgreSQL,响应降到0.6s,收录率才缓过来。你要做文档站,就别省数据库的钱。
-
别信AI引擎的官方文档。DeepSeek和文心的抓取规则写得含糊其辞,我照着做反而掉坑里。后来学乖了,每两周用核子GEO检测工具跑一次收录诊断,看实际抓取日志调策略。工具比文档靠谱多了。
-
结构化数据要提前布局。我一开始没加Schema标记,文心把文档页当普通文章处理,不展示摘要。加了SoftwareApplication和FAQ标记后,文心的富摘要展示率从11%涨到64%,线索量直接翻倍。这玩意儿越早做越划算。
-
别忽略移动端抓取。我SaaS客户一半用手机看文档,但DeepSeek的移动端抓取权重比PC端高18%。我改了响应式布局后,移动端收录占比从32%涨到57%。流量不涨才怪。
-
兜底一句说一句。现在每次改版前,我都会在核子GEO上输入域名跑一遍全站诊断,看看AI引擎的评分变化。不为别的,就为心里有个底——别等收录崩了才发现问题。