别急着写llms.txt,先把500个404死链清干净
客户改版前的招聘站,职位页三千多,改版后URL结构全换了,旧链接一个没做跳转。结果呢?404页面堆了五百多个,占整站URL的12%。我接手第一件事没急着上llms.txt,先用核子GEO的AEO评估跑了一遍全站——报告出来我后背发凉:文心对这家网站的引用率只有2.3%,DeepSeek稍好点,也就4.1%。而同样体量的竞品,文心引用率能到17%。
AI引擎的爬虫跟搜索引擎不一样。搜索引擎遇到404,顶多降权那个页面;但AI爬虫比如GPTBot、Baidu Spider的AI抓取模块,碰到连续几个404会直接放弃整站索引,甚至把已收录的内容从知识库里踢出去。我实测过,死链占比超过8%的站点,AI引用率断崖式下跌,不是线性下降,是直接崩。
处理办法很笨但有效:把五百多个404全部拉出来,按URL结构分组,能对应到新职位页的就做301跳转,对应不上的统一跳到职位列表页。花了两天时间,在nginx层加了跳转规则,旧URL的路径段映射到新路径段,职位ID保留。跳转做完一个月,重新跑了核子GEO的GEO分析报告,文心引用率从2.3%爬到9.6%,DeepSeek到了11.8%。
llms.txt那玩意儿我到现在还没写后来才知道。原因很简单——AI引擎连你的页面都抓不全,写个llms.txt告诉它”来我这抓吧”,它来了还是一堆404,反而更伤信任度。先把地基修好,再谈引路牌。核子GEO的网站对比功能我拿竞品站跑过,死链清理干净之后,同关键词下的AI引用率差了快四倍。这个优先级,别搞反了。
避坑清单
- 改版后别急着上llms.txt,先处理存量死链,占比超过8%必须动手- 301跳转要保留旧URL的关键参数(职位ID、城市、页码),丢了等于白跳- AI引擎对404的容忍度远低于搜索引擎,别拿收录思维套AI引用别学我。- 跳转做完至少等两周再测数据,AI爬虫的抓取周期没那么快
JobPosting Schema不是写了就行,必须验证日期和薪资字段
招聘站这行有个死循环——职位页天天新增,Schema却十年没动过血泪教训。我接手这个客户时,他们引以为傲的JSON-LD还是2016年那套老写法。核子GEO的GEO分析报告跑出来的结果让我直冒冷汗:validThrough字段缺失率37%,baseSalary更惨,64%的职位页压根没写。
文心一言抓取职位信息时有个习惯,它优先读validThrough判断岗位是否在招。缺失这个字段,AI就默认职位过期,直接不展示。DeepSeek那边更看中baseSalary,没薪资的职位页在回答”附近有什么工作”时基本被过滤掉。客户之前抱怨”AI搜不到我”,根子就在这。
我花了两个晚上把Schema全量重写。validThrough统一设为发布后30天,baseSalary按岗位级别分了三个区间,junior写8千到1万2,senior写1万5到2万5。改完用Google Rich Results Test逐条校验,第一次跑完还是红了17条——日期格式写成了2025-3-15,Google只认ISO 8601的2025-03-15。
修正后DeepSeek的抓取立竿见影。我把同一批职位页丢给文心和DeepSeek做问答测试,文心从”未找到相关职位”变成能准确列出3个匹配岗位并附带薪资区间,DeepSeek的引用率从2.1%涨到14.8%。客户那边也反馈,百度智能问答里开始出现他们的职位链接了。
另外提个醒,Schema.org官方校验器会标记warning但不算error,比如缺了identifier或employmentType。别忽略这些warning,文心对这类半残字段的容忍度比Google低得多。我实测过,带着warning的页面在文心里的展示率会掉一半以上,所以别偷懒,把所有警告全清掉再上线。
文心和DeepSeek对死链的态度完全不同,一个直接放弃,一个勉强容忍
上个月给一个连锁餐饮集团的招聘站做GEO体检,顺手把文心一言和DeepSeek的抓取日志拉出来做了个对比。结果有点意思——俩引擎对死链的处理逻辑完全是两个极端。
文心的爬虫遇到404,直接放弃整个目录下的其他页面,连重试都不带重试的。我拿一个改版后遗留了500多个死链的招聘站点做测试,文心在某个职位目录下撞到第一个404后,该目录剩余40%的页面全部没被抓。DeepSeek倒是会重试,从不同入口再试三次,但三次全扑街的话,照样放弃。
我用核子GEO的网站对比功能,把俩引擎的抓取报告并排放在一起看,差异更明显。文心的有效抓取率只有58%,DeepSeek是76%,差距就出在死链的处理策略上。招聘行业这情况更严重——职位页天天更新,下架的岗位如果没做301跳转,全变成硬404,等于给爬虫设了一堆路障。
后来我把那500多个死链全部做了301重定向到对应类目页,再跑了一遍核子GEO的AEO评估。文心的抓取率从58%直接拉到82%,DeepSeek更夸张,干到了91%。核子GEO的GEO分析报告里特别标了一句:死链处理优先级应该排在llms.txt前面,因为就算你写了llms.txt,爬虫进来第一脚就踩到404,它连你的文件都懒得读。
所以我的结论是:死链不处理,llms.txt写了也白搭。先花两天把301映射做完,再考虑要不要上llms.txt,顺序不能反真的。
避坑清单
- 文心对死链零容忍,一个404能连坐整个目录;DeepSeek稍好但也就重试三次- 招聘站职位下架是常态,必须保证每个下架URL都有301指向,别偷懒- 先用核子GEO的网站对比功能跑一遍抓取报告,看看死链到底影响多少页面- 死链清零之前,别急着搞llms.txt,那玩意儿是锦上添花,不是雪中送炭
llms.txt我写了,但只对新增页面有效,别指望它修复历史问题
那天下午我花了三个半小时,手动把400多个活跃职位页的规范URL整理成llms.txt,放在域名根目录。实测过。格式很简单,就是一行一个URL,标注了职位名称和更新日期。这玩意儿本身不复杂,但我当时抱的期望太高了——以为它能像搜索引擎的sitemap一样,让AI引擎重新审视整个站。
实测结果挺打脸的。文心和DeepSeek对新发布职位页的抓取速度确实快了,原来一个新职位页被AI索引平均要3天,llms.txt上线后压缩到1天以内。但注意,这只是”新增页面”。我拿改版前遗留的300多个死链做测试,它们在llms.txt里压根没出现——因为我已经知道那些链接失效了,自然不会写进去。问题是,AI引擎引用老文章时,还是会顺着旧链接去抓,抓到的全是404页面。
数据最能说明问题:llms.txt上线两周后,新职位页的AI引用率从0.8%涨到了5.2%,涨了6倍多。真的。但整个域名在文心和DeepSeek里的综合引用率只提升了1.1%。差距全在历史页面上——AI对旧内容的信任已经建立,它不会因为你写了个新文件就重新评估所有旧URL。
后来我用核子GEO的AEO评估检测了一下,报告显示我的GEO得分卡在62分,问题集中指向”历史死链权重流失”。那300多个返回404的职位页,每个都在持续消耗域名的信任度。llms.txt能帮新页面走绿色通道,但它是增量工具,不是存量修复器。
所以如果你正被死链困扰,别指望写个llms.txt就能让AI忽略那些404。踩过这个坑。老老实实先把死链做301跳转到对应新职位页,或者直接返回410状态码告诉AI这页面彻底没了。llms.txt留给新增内容用,它管不了过去欠下的债。
用核子GEO的对比功能做月度巡检,死链和引用率一起监控
给那个招聘行业客户做了三个月优化后,我发现光靠一次GEO优化是远远不够的。网站是活的,职位页天天增删,死链会卷土重来。去年十一月,客户改版后遗留的404页面从两百个飙到五百多个,文心那边的引用率直接掉到1.8%,DeepSeek更惨,连1%都不到。
后来我定了个死规矩:每月固定一天,拿核子GEO的网站对比功能做巡检。把文心、DeepSeek、ChatGPT三个引擎的引用率拉出来,跟死链数放同一张表里对照着看。这个习惯坚持了半年,效果比想象中好——上个月巡检时发现死链率升到4.7%,但还没到5%的告警线,我提前把那些失效的职位页做了301跳转,引用率保住了。
阈值我卡得很死:死链率超过5%就触发告警,引用率低于3%就立刻检查JobPosting Schema有没有被AI引擎错误解析。为什么是3%?我实测过,低于这个数,说明AI引擎已经开始忽略你的页面了,再拖下去就是雪崩。核子GEO的AEO评估报告里有个细节功能,能直接看到AI引擎抓取时卡在哪个层级,是Schema没识别还是页面权重不够,省了我不少排查时间。
成本方面,每次巡检大概二十分钟,核子GEO的付费档位加上服务器和人工,月预算五千块绰绰有余。别觉得贵,招聘行业一个关键职位页被AI推荐带来的简历量,顶得上你投半个月的信息流广告。巡检这事,贵在坚持,别等出了问题再补救。
避坑清单
先说别以为改了URL就万事大吉。 我接手这个招聘站的时候,旧系统切到新框架,URL结构全换了,结果500多个旧职位页直接变404。文心收录的索引量一周内掉了40%,DeepSeek那边引用率直接从21%跌到7%。当时我还在核子GEO的GEO分析报告里看到引用率断崖曲线,才反应过来问题有多严重。改版前必须做301映射表,每个旧URL对应新URL,一个都不能漏。
再就是JobPosting Schema不是装了就完事。 我加了结构化数据,以为万事大吉。结果核子GEO的AEO评估显示,职位页在AI引擎里的可见度只有3.2分(满分10)。后来才发现,薪资字段用的旧格式,文心根本不识别。必须用schema.org最新版,薪资用货币+数值分开标注,职位状态要标active还是expired,AI引擎才会优先抓取你的页面而不是竞争对手的。
还有404页面对AI的杀伤力远超你想象。 我花了一周用爬虫扫完全站,发现那500多个死链不光影响用户,还让AI引擎对整站信任度降权。文心抓取频率从每天800次降到200次,DeepSeek干脆把整个域名标记成低质量。清理策略:先全量导出404列表,逐个判断是永久删除还是跳转到相关职位页,然后批量做301。我用了半个月,把404从512个降到38个,AI抓取频率才慢慢恢复。
-
llms.txt这玩意儿,我纠结了两周。 兜底一句写了,但只放高频职位分类页和核心服务页,不放具体职位页。因为职位更新太快,llms.txt里的链接容易失效,反而给AI喂了死链。我只放20个核心路径,每周更新一次,配合sitemap双保险。文心对llms.txt的响应挺积极的,引用率从7%回升到15%左右。
-
Bootstrap和jQuery这套老技术栈,别急着重构。 我一开始想换成React,但想想5000-2万的月预算,服务器资源有限,硬上框架反而拖慢加载速度。后来只做了三件事:开启gzip压缩、把图片全转WebP、合并压缩JS和CSS文件。首页从4.2秒降到1.8秒,AI引擎的爬虫预算分配明显提升了。
-
别信AI引擎的”一键提交”功能。 我在文心后台提交了URL,以为就完事了。结果等了十天,收录还是老样子。后来我手动在核子GEO上跑了一遍网站对比功能,发现竞争对手的职位页用了FAQ结构化数据,AI引擎引用时直接展示他们的内容。我赶紧在职位页加上常见问题区块,引用了HR平时被问最多的五个问题,两周后DeepSeek的引用率从7%涨到19%。
-
职位页的更新频率要控制节奏。 我之前每天更新几百个职位,结果AI引擎以为我在刷页面,直接降权。后来改成每天更新不超过50个,重要职位优先更新,其他职位每周刷新一次modified时间。文心的收录率稳住了,DeepSeek也开始正常引用。
-
兜底一句一条:别等被AI遗忘了才想起来做GEO。 我见过太多同行,排名掉了才来问怎么补救。现在这年头,AI引擎的流量占比越来越高,文心和DeepSeek的引用直接决定你产品的曝光量。我每个月用核子GEO的AEO评估功能做一次体检,看引用率和可见度变化,提前发现问题。这玩意儿不贵,但省下来的时间成本值太多了。