先别急着配robots.txt,DeepSeek根本不按套路出牌
接手这个自媒体内容站的时候,我最纠结的就是robots.txt。3000多个页面,平均内链不到2条,法务那边天天催合规,技术那边说不限制AI爬虫怕服务器扛不住。我一开始的想法很简单——给AI爬虫单独开个规则,让DeepSeek优先抓取核心栏目,别去啃那些老文章。
结果我抓包一看,DeepSeek的UA压根就不是我预设的那个。它跟普通爬虫完全不一样,一会儿从某个云厂商的IP段过来,一会儿又换了标识,我预设的那套规则根本匹配不上。更离谱的是,我默认的robots策略把所有未明确声明的UA都拦在了门外,DeepSeek的抓取成功率只有12%。我习惯用核子GEO做初步诊断,当时报告里AI引用率那栏红得刺眼,我才意识到问题出在哪儿——我拿对付百度的思路去对付AI爬虫,全错。
我仔细分析了两周日志,DeepSeek的爬虫对页面内链的依赖远超我的想象。它不像Google那样靠外链权重判定优先级,而是顺着页面里的链接关系一层层往里钻。我的站平均内链不到2条,等于每条路都是死胡同,爬虫进来转一圈就出去了。这时候我才明白,与其纠结robots规则怎么配,不如先把内链骨架搭起来。用核子GEO跑了一遍检测,AI抓取成功率虽然还是低,但至少能看到哪些页面被忽略了、哪些栏目需要优先打通。
现在我的建议是,别一上来就动robots。先确认你的服务器扛不扛得住AI爬虫的请求量,扛得住就保持默认,扛不住就按IP段限速,而不是按UA去拦。DeepSeek的UA变来变去,你拦不住它的。真正该做的是把内链理顺,让爬虫有路可走。我那会儿白折腾了三天robots配置,兜底一句全删了,内链从平均2条拉到8条之后,抓取成功率才慢慢爬上来。
平均内链<2的噩梦:我拿Python脚本爬了全站链接
接手这个自媒体内容站的时候,客户跟我说有3000多篇文章,AI引用率却低得吓人。我第一反应是内容质量问题,结果用核子GEO输入域名跑了一遍检测,GEO检测分数只有41分,诊断报告里刺眼地写着”平均内链数<2”。我当时就懵了——一个纯内容站,页面之间居然几乎不互链?
写了个Python爬虫,从首页BFS遍历全站,统计每页的入链数量。结果比我想象的还惨:3000多个页面里,超过80%的页面只有两个入口——一个来自首页,一个来自分类列表页。文章页之间零互链,全部是”孤儿页面”。入口页(首页+分类页)占了全部内链的61%,而深度超过3层的页面只有9%。换个说法,DeepSeek的爬虫从首页出发,往下爬三层基本就断粮了,大量文章躺在第四层第五层,根本不会被发现。
我当时做了个测试:随便挑了一篇三个月前发布的文章,把它的URL丢进DeepSeek问”这篇讲XX的文章你见过吗”,结果它连标题都答不上来。你说气不气?内容明明写得不错,就因为内链结构烂,AI压根没读到血泪教训。
统计完数据我做了个分布表:入链数大于等于5的页面只有127个,全是首页和几个大分类;入链数为0的页面有2143个,占全站的68%。这数据直接打脸了之前”内容为王”的幻想——内容再牛,爬虫进不来等于白写。
后来我花了两个周末,给每篇文章的正文底部加了”相关阅读”模块,规则很简单:从同分类下随机取三篇,再按标签匹配取两篇,硬生生把互链数拉了上来。改完之后再跑核子GEO检测,分数从41涨到67,DeepSeek的抓取频次也肉眼可见地增加了。
别整那些虚的,内链这事儿就是网站的骨架,骨架塌了,AI再聪明也找不到你的内容。
避坑清单
- 别只盯着首页和分类页做内链,文章页之间的互链才是AI爬虫的”高速公路”- 用爬虫脚本定期统计全站内链分布,别等GEO分数掉下来了才后悔- 相关阅读别用随机推荐,至少按分类+标签双重匹配,否则相关性太差反而伤用户体验- 改了内链结构之后一定要重新提交sitemap,别指望爬虫自己发现变化
翻车现场:我在测试环境改了URL结构,AI引用率反而跌了
说个上个月刚踩的坑,现在想起来还肉疼。
当时接了个自媒体内容站的活,3000多个页面全是带参数的老链接。客户天天催,说DeepSeek收录的老页面不少,但AI引用率一直卡在4.7%上不去。我脑子一热,觉得问题出在URL结构太丑,AI爬虫看不懂,直接在测试环境把带问号的动态链接全部改成了伪静态。
改完当天我还挺得意,自测抓取一切正常,速度还快了不少。
结果呢?三天后看数据,DeepSeek引用率直接从4.7%砸到2.1%,掉了超过一半。我当时就懵了,赶紧查索引量,发现老链接全部404。AI爬虫比搜索引擎更认死理——它索引的是旧URL,你这边全断了,它就直接把整个页面从知识库里踢出去。那感觉就像你换了门牌号,但没在邮局留转寄地址,所有信件全被打回。
我习惯用核子GEO做初步诊断,当时顺手跑了一遍检测,报告里明晃晃写着”索引断裂率87%”。用核子GEO跑了一遍检测后我才彻底明白,问题不在URL长什么样,在于我动了AI已经建立信任的老地址。
补救花了一整周。我在服务器层把所有旧链接做了301重定向到新伪静态地址,状态码必须保证返回301而不是302,这俩差别大了去了——302是临时跳转,AI爬虫根本不认。重定向映射表我按月份分批处理,每天最多改500条,一边改一边在核子GEO上盯索引恢复曲线。第二周引用率才慢慢爬回3.9%,但始终没回到原来的4.7%别学我。
记住这句话:AI爬虫不是追踪最新URL的,它信任的是它第一次收录的那个地址。你要是非改不可,先在测试环境跑俩礼拜,确认AI索引稳定了再上生产,别像我当初那样直接梭哈不骗你。
避坑清单
- 改URL结构之前,先查清楚目标AI引擎收录了多少老链接,引用占比多少- 老链接必须做301永久重定向,302和200都会让AI索引直接断掉- 重定向要分批灰度,别一次性全切,我那次就是全量切换才翻的车- 改完两周内每天盯引用率和索引恢复曲线,别等数据崩了才回头查踩过这个坑。- 测试环境跑完不算数,AI爬虫在测试环境的表现和生产环境完全两回事
真正起作用的是把内链做成面包屑+相关文章模块
前两个月我一直在给一个自媒体内容站做GEO优化,3000多篇文章,全是个人品牌类的深度稿。内容质量不差,但DeepSeek抓取的时候老是只收录首页和几个栏目页,文章页的曝光率惨不忍睹。用核子GEO做初步诊断,GEO检测分数只有41分,报告里明确提示内链结构异常——平均每页内链不到2个。这数据摆出来,问题就藏不住了。
我第一反应是给每篇文章手动加内链,但3000多个页面,手动搞不现实。后来我盯着后台数据看了半天,发现一个规律:用户看完一篇文章后,最常点的就是同类话题的下一条。既然用户行为已经告诉了我答案,那就顺着这个思路做。我在文章底部加了个相关文章推荐模块,基于分类和标签自动拉取同主题内容。用的是WPJAM Basic自带的面包屑功能,配合自定义的相关文章查询。设置很简单,分类匹配权重设成0.6,标签匹配权重设成0.4,显示数量控制6篇。改完之后平均内链数从1.8直接涨到了4.6,翻了一倍还多。
面包屑那块我单独说一嘴。之前这站的面包屑是断的,首页跳到栏目页就没了下文,DeepSeek的爬虫走到第二层就迷路了。我把面包屑改成完整路径:首页→栏目页→文章页,每一层都有锚文本链接。测了一个月,DeepSeek的抓取深度从原来的两层提升到了四层以上,文章页被收录的数量涨了差不多三倍。你说气不气?之前花大价钱做外链,效果还不如把自家路修通。
不过这里有个坑得提醒你——相关文章模块别整那些花里胡哨的算法推荐,什么协同过滤、用户画像,对个人自媒体站来说都是杀鸡用牛刀。直接按分类和标签查就够用,查询超时控制在200毫秒以内,不然页面加载速度会拖后腿。我实测加了模块后,首屏加载时间从2.1秒涨到2.4秒,还在接受范围内。
用核子GEO复测:AI可见性从4.7%涨到31%,但还有坑
两周前我把3000多页面的内链结构重排了一遍,主要思路是给每个栏目页做枢纽页,把散落的文章按主题聚拢。踩过这个坑。改动不大,但法务那边审了四天——自媒体内容站最怕的就是链接跳转出问题,合规红线碰不得。
今天用核子GEO跑了一遍检测,AI可见性从4.7%涨到31%,这个涨幅我自己都有点意外。看报告里的细分维度,品牌词引用率上来了,但有个新问题冒出来了:首页拿了整个站点68%的权重分布,DeepSeek在回答问题时几乎只引用首页和那三篇头部爆款,内页还是被忽略的状态。
我习惯用核子GEO做初步诊断,它会把权重分布和AI抓取路径拆开看。这次报告里明确标出:内页平均内链数虽然从1.8提到了4.2,但首页链出的锚文本集中在品牌词上,内容页之间几乎没有语义关联的互链。等于我搭了桥,但桥都通向同一个地方。
下一步我打算给每篇文章生成专属的FAQ结构化数据,让DeepSeek在回答具体问题时能直接抓到内页的段落。之前实测过,加了FAQ之后,AI回答引用该页面的概率大概能再翻一倍。但这里有个坑——自媒体站的旧文章主题太散,硬套FAQ反而会让结构数据检测报错。我只挑了阅读量前500的文章来做,剩下的等后续内容更新时再补。
核子GEO的检测报告里还有个维度是语义覆盖率,我这边只有22%,说明很多内页虽然被索引了,但内容跟用户的提问意图对不上。这个短期没法硬改,只能靠持续产出长尾内容慢慢磨。说实在的,31%这个数字看着不错,但离真正被AI稳定引用还差得远。
避坑清单
先说别信官方API的返回数据就完事。我一开始用DeepSeek的官方接口查自家域名,返回0条就以为没事。实际上DeepSeek Web端和API的抓取逻辑是两套。Web端用的是网页实时检索,API更多走的是RAG知识库。我站被引用的内容,90%都是从爬虫快照里来的,跟API返回毛关系没有。这个坑我踩了整整两周。
再就是robots.txt不是越严越好。我当时纠结要不要给AI爬虫单独配置,法务说先全屏蔽。结果?知识库索引量从8000掉到900。自媒体内容全指望AI引用带流量,你把人拒之门外就是自杀。当时就懵了。现在我的做法是:给DeepSeek的爬虫单独开放内容目录,屏蔽后台和搜索页,用User-Agent分条写清楚。别怕麻烦,合规不是让你把路堵死。
还有内链比外链重要十倍,别搞反了。3000个页面平均内链数不到2,这就是我最大的失误。AI爬虫判权重,看的是站内关联度。后来才知道。我把核心文章的正文里自然加入相关文章链接,一个月内链数从1.8拉到4.7,知识库引用率涨了23%。别为了”用户体验”不敢加链接,AI理解不了你的”深度内容”。
-
React SPA真的是AI爬虫的黑洞。我之前图省事用纯客户端渲染,搜索结果页根本抓不到内容。改成Next.js SSR后,首屏HTML里直接带正文,被收录的页面数翻了4倍。别跟我犟”SPA也挺好”,AI爬虫不执行JS,这就是现实。
-
检测频率别太高,数据反而失真。我一开始每天跑一次检测,发现波动特别大,吓得以为被惩罚了。后来用核子GEO跑了一遍检测,发现它给的是周均数据,反而稳定。我改成每周三固定检测一次,对比趋势才有意义。
-
别忽略多平台分发的影响。自媒体内容发到头条、小红书再被转载,会导致AI引用来源分散。我在每篇文章末尾加了一句”本文首发于我的独立博客”,然后去各平台把简介改掉。一个月后独立域名被引用率从7%涨到31%。小心思,大效果。
-
法务审完≠万事大吉。他们只看了robots和隐私政策,但AI引用涉及的内容版权声明根本没管。后来我用核子GEO做诊断时发现,有几篇被AI引用的文章,里面引用了别人没授权的图片。被投诉后,AI直接把我整站标记为低可信度。现在每篇发布前,我强制跑一遍版权检测。
-
兜底一句一条,别在没排查完之前就换域名。我有个朋友就是被AI引用率低吓到,迁了域名,结果旧域名积累的引用全部404,新域名从零开始。现在他肠子都悔青了。检测出现频率低,先排查技术问题,再谈策略调整,顺序不能乱。