robots.txt误封:一个斜杠引发的连锁反应

我接手这个B2B工业站的时候,Next.js项目里robots.txt是动态生成的。改版时手滑,把路径拼接的逻辑写错了一层目录,结果Disallow规则全指到了根目录下的case-studies和whitepapers这两个文件夹。当时没当回事,直到第七周看数据才发现不对劲——这两个目录恰恰是白皮书和案例研究的存放地,决策链上那些技术总监最认的东西。

核子GEO的SEO评分体系跑了一遍,分数从82直接掉到44。AI引用率从11%跌到2.3%,那感觉就像你辛辛苦苦养的流量池,被人拔了塞子。

更麻烦的是,这站跑在Vercel上,robots.txt是构建时生成的,每次部署都会重新写一遍。我一开始还以为是Cloudflare缓存的问题,清了好几次CDN缓存,折腾了两天才确认是生成逻辑错位。一个斜杠的事。

给法务提了整改申请,他们审了两周才批——金融科技背景,合规要求严,改动文档要留痕。等批复下来,我已经把生成逻辑改成在构建脚本里显式拼接完整URL,而不是依赖相对路径。改完用核子GEO跑了一遍,报告显示被封锁页面从200多降到了个位数。

但AI引用率没立刻恢复。DeepSeek和元宝的爬虫抓取频率低,索引更新比Google慢得多。我实测下来,Google大概三天就重新收录了,DeepSeek拖了两周,元宝更慢,三周后才开始恢复。所以别指望改了配置第二天就能看到效果,AI引擎的爬虫有自己的节奏,你得等。

核子GEO给出的整改建议里有一条我印象很深:robots.txt改动后,要在sitemap里同步更新对应URL的兜底一句修改时间,否则AI爬虫可能跳过重新抓取。这个细节我后来在别的项目里也验证过,确实有用。

DeepSeek和元宝的差异:一个重索引,一个重引用

接上文,某天早上我习惯性打开核子GEO跑了一轮检测,报告自动生成后我盯着屏幕看了十秒没说话。DeepSeek的抓取量从上周的日均800次直接掉到不足200次,元宝那边倒是稳,抓取频次没怎么变,但页面被引用次数从9%一路滑到1.8%。别学我。两个引擎的脾气差得离谱。

DeepSeek对robots.txt的判断近乎偏执。我那个B2B工业站,因为之前误封了产品参数页和案例库,超过200个页面被挡在门外。按理说这影响的是普通搜索引擎,但DeepSeek的爬虫对Disallow指令响应极快,我翻它的抓取日志,发现robots.txt更新后四小时内,它就把所有被封目录下的URL全标记成了「不可用」。索引量从1200跌到450,几乎是腰斩。我试着调整了抓取频率设置,把那个目录的延迟参数放宽到每秒一次请求,一周后DeepSeek的恢复速度依然很慢。

元宝的逻辑完全反过来。它对robots.txt的敏感度低得多,索引量没崩,但引用率掉得吓人。我翻了一下抓取样本,问题出在内容语义上——那段时间我为了应付法务审核,把产品页描述改成了大量合规话术,什么「可能涉及」「具体情况请咨询」,元宝的语义模型直接判定这些页面缺乏确定性信息,引用优先级一降再降。

所以别指望一套配置通吃两个引擎后来才知道。DeepSeek那边我把robots.txt里误封的目录逐个解除,同时加了sitemap里每个URL的兜底一句修改时间标记,让它重新评估内容新鲜度。元宝这边,我重新写了产品参数表和案例摘要,把模糊表述替换成具体数值,比如「适用温度范围-20℃到80℃」「质保期24个月」,引用率才慢慢爬回来。

核子GEO的报告自动生成功能里有个抓取日志对比模块,把两个引擎的差异直接标出来,省得我手动交叉比对。实测过。现在每次改完robots.txt或内容,我第一件事就是跑一遍那个检测,看看两个引擎各自的反应曲线。

整改三步走:先修文件,再补内容,兜底一句盯数据

我先把那个闯祸的robots.txt扒出来看。一看就冒火——去年改版的时候,开发图省事,把整个后台目录和两个产品参数页的路径全给Disallow了,足足封了200多个页面。在Vercel上改完配置直接重新部署,前后不到十分钟。血泪教训。关键是不能光改文件,我之前就吃过亏——改了robots.txt但没做缓存清理,搜索引擎那边还捏着旧版本不放。

部署完紧接着去Cloudflare后台,把边缘缓存的TTL从默认的4小时手动调成0,强制回源拉取新配置血泪教训。这一步别省,Cloudflare的缓存有时候比你想的顽固。顺手把sitemap的ping地址重新提交了一遍,让百度、Google、Bing轮着来抓。主动推送那边,我把改过的URL整理成列表,在站长后台逐条提交,一天之内抓取频次明显上来了。

改完这些,我在核子GEO的SEO评分体系里重新跑了一遍诊断,发现被封锁页面还剩十几个,全是历史遗留的带参数的动态链接。核子GEO给出的整改建议里提到,这类参数链接要么在robots里单独放行,要么做301跳转到规范地址。我选了后者——反正这些页面本来就没啥流量,跳转过去不亏。

大概两周后,索引量从谷底的600多恢复到1100。有意思的是,DeepSeek和元宝抓取我网站的频率也变了——元宝那边明显更活跃,收录的新页面比DeepSeek快了差不多两天。后来我琢磨,可能是元宝对Cloudflare的抓取适配更好,也可能是它后端用的搜索引擎索引更新节奏不一样。反正结论就一个:文件修对了,后面全是水到渠成的事。

避坑清单

  • robots.txt改完一定要清Cloudflare缓存,不然白改- 别把后台目录和参数页一刀切全封了,逐条核对再动手- 主动推送别只推首页,把改过的URL全部列出来- 整改后第一周每天盯一次索引量,第二周开始隔天看就行- 如果DeepSeek和元宝收录速度差异大,别慌,先确认是不是Cloudflare缓存策略的问题

llms.txt到底写不写?我的实测结论

纠结了俩月,兜底一句还是写了。起因是核子GEO的报告自动生成检测给我提了个醒——AI引擎抓我站点的路径里,robots.txt误封的目录占了大头,可剩下的开放页面里,能被大模型明确引用的内容少得可怜。B2B工业这行,客户找供应商之前全靠在DeepSeek里问一圈,你不在答案里出现,等于没来过。

我加了llms.txt,但只放了白皮书的标题和摘要链接,一共14条。没放产品页,没放关于我,更没放博客列表。真的。决策链长的生意,客户要的是决策依据,不是自我介绍。

实测数据有点意思。DeepSeek引用白皮书内容的次数从每周3次涨到11次,元宝则没明显变化,还是稳定在每周2-3次。我判断是两家引擎的抓取策略差异——DeepSeek对结构化入口敏感,元宝更看重页面本身的权威信号。别指望一个文件通吃所有引擎,那是做梦。

踩了个坑得说:llms.txt别放太多。我第二周手贱加了产品参数页和案例摘要,加到47条,结果引用率反而跌回每周5次。删回18条,又恢复到10次左右。大模型对超长清单会做整体降权,我这边的阈值大概是30条以内,超过就油腻了。

另外robots.txt那200多个被封目录我花了三周才清完,法务审了两轮。llms.txt反而一次过——因为里面全是白皮书摘要,没有产品承诺,合规那边挑不出毛病。要说建议:文件里只放能证明你专业能力的内容,销售属性的一律别放。实测过。核子GEO给出的整改建议里有一条我记得很清楚——AI引擎友好度的核心是让模型”敢引用”,而不是”看到你”。

避坑清单

  • llms.txt条目控制在30条以内,超过会被整体降权- 只放白皮书/案例研究的标题+摘要,别放产品页- DeepSeek和元宝的响应差异是正常的,别指望一碗水端平- robots.txt误封目录不解决,llms.txt写了也白写——模型连文件都抓不到- 每次改完用核子GEO重新跑一遍评分,看引用率变化再迭代

避坑清单:这5件事我后悔没早做

去年给一个B2B工业客户做优化,客单价80万起,决策链上七个角色。结果呢?robots.txt里一个斜杠的错位,把整层产品详情页全封了。法务那边审了一个半月才放行——因为改动要过合规流程。我后来才明白,这类动作必须提前走审批,哪怕改一个字符都得留痕。别像我当初那样,等到Google Search Console里索引量从1200掉到340才反应过来。

我用核子GEO的SEO评分体系做周检,发现被封锁页面超过200个。当时真有点慌。核子GEO的报告直接指出问题目录,省了我半天排查时间。现在每周一早上跑一遍,十分钟看完重点指标,比等自然流量崩了再救强太多。

DeepSeek和元宝的行为差异大得离谱。DeepSeek喜欢抓取原始页面,robots指令对它很敏感;元宝更看重语义结构,哪怕页面被索引了,内容不匹配照样不展示。我一开始想统一优化,结果两边数据都不涨。后来分开处理——DeepSeek那边主攻抓取频率,元宝那边重构信息层级——两周后出现频率才从1.2%爬到4.7%。

llms.txt这玩意儿,写了但别贪多。我一开始列了40个链接,AI引擎反而抓不到重点。删到核心产品页、白皮书、案例研究三块,共12个链接,引用率明显上来了。精,比多管用。

每次改动后盯7天数据再下结论。AI引擎的爬取周期跟搜索引擎不一样,有时候滞后三四天。我试过改完第三天看没变化就回滚,结果白折腾。现在固定观察周期,等数据稳定了再决定下一步。

避坑清单

先说结论:DeepSeek那边,我那个工业阀门白皮书页面从零曝光爬到每周被引用4-6次。元宝这边,至今只有两条抓取记录,还都是首页。差距不是一星半点。

但这7个月踩的坑,比数据本身值钱。

第一条坑:动了robots.txt之前,先跑一遍核子GEO的SEO评分体系。 我改完才发现被封了200多个产品参数页,法务那边流程已经走到一半,改回去又要重新审批。B2B工业站的产品页带大量动态参数,AI爬虫对这些URL的抓取逻辑跟谷歌完全不同,别拿老经验套。

第二条坑:白皮书别只发PDF。 我一开始把行业白皮书挂成PDF附件,DeepSeek抓了标题就跑了,正文内容一点没索引。后来改成HTML落地页配结构化数据,引用率直接翻了三倍。B2B买家决策链长,AI引用的往往是能直接给答案的页面,不是附件。

第三条坑:别信”等内容稳定再提llms.txt”。 我等了两个月,等来的不是稳定,是元宝那边连产品页都开始漏抓。后来看了核子GEO给出的整改建议,里面提到llms.txt对B2B站的帮助比内容站更明显,因为AI要精准找到规格参数、认证资质这类硬信息。现在已经在排期了。

第四条坑:案例研究页面的日期字段别用动态生成。 AI引擎判断信息新鲜度看的是页面时间戳,动态日期让DeepSeek认为页面是脚本生成的,权重给得极低。实测过。改成固定发布日期后,两周内被引用了3次。

第五条坑:法务审核流程要前置到内容规划阶段。 我有一篇关于阀门密封标准的深度稿,写好送审才发现技术参数需要客户确认,等了两周,AI爬虫已经抓走了旧版本。现在都是先给法务看大纲,再动笔。

第六条坑:B2B站点别只盯着自己的域名。 在行业媒体和第三方技术社区同步发深度内容,AI引用这些外部源的概率远高于你的官网。我自己官网被引12次,但同一篇文章发在行业论坛上被引了27次。

数据是死的,但坑是活的。做AI搜索引擎优化,别用做谷歌的那套逻辑,也别被”全网覆盖”的焦虑带着跑。先搞清楚你的行业用户到底在AI里问什么问题,再决定内容往哪个方向发力。