第一步:在核子GEO上跑诊断,发现AI引用率只有3.2%
说实话,我刚开始压根没把AI引用率当回事。去年给一个在线教育站做完技术优化,流量涨了40%,自我感觉良好。直到有天我在核子GEO上输入域名,跑了一遍检测报告,那结果直接给我泼了盆冷水。
报告显示AI引用率只有3.2%。什么概念实测过。?行业均值是15%左右,我连个零头都没摸到。我当时就懵了——明明内容质量不差,课程页面每周更新,资讯站每天发3-5篇原创,怎么AI就不认?
往下翻了翻详细报告,问题浮出水面。不骗你。NLP语义匹配度只有27%,正常应该在60%以上。更扎心的是,AI爬虫在我网站上的有效爬取率不到一半,大量请求都被引导到了资讯页那些老掉牙的“2023年招生简章”上。
你说气不气?我花了大半年时间堆内容、调性能、搞结构化数据,结果AI引擎压根没读到核心课程的页面。核子GEO给出的整改建议里,第一条不是让我继续加内容,而是重新规划爬虫引导策略。
我这才意识到——不是内容有问题,是爬虫不知道往哪走。就像你开了一家商场,每个柜台都摆了精品,结果入口牌子上写着“后门垃圾桶方向”,谁找得到?
第二步:给AI爬虫单独开一条道——robots.txt别瞎改
之前我干过一件蠢事。去年给一个K12在线教育站做优化时,看网上教程说“禁止AI爬虫能省带宽”,我直接在robots.txt里把GPTBot和ClaudeBot全部Disallow了。结果呢踩过这个坑。?整整三个月,ChatGPT和文心一言搜我品牌名,啥都没有。AI引用率直接挂零,你说气不气。
后来我用核子GEO的搜索引擎推送检测了一下,结果显示GPTBot抓取历史为0,我才意识到问题出在哪儿。原来AI引擎跟传统搜索引擎不一样,它们更看重内容的结构化程度和时效性。
我改了策略。不再一刀切Disallow,而是给AI爬虫单独开一条窄道。具体配置是这样的:User-agent GPTBot这行,Allow只有两个目录——/course/和/faq/,Disallow掉/tag/和/old/。ClaudeBot也一样处理。为什么要这么干?课程页和FAQ页是我站最核心的内容,标签页全是重复的聚合页,旧版本课程已经没时效性了,AI抓了反而稀释品牌权重。
改完后两周,我盯着服务器日志看。第一天还是0,第二天突然蹦出来3次,到第十天日均抓取量稳定在217次。虽然跟Googlebot一天几万次没法比,但起码AI开始认我这个站了。
当时我也纠结过要不要给AI爬虫单独配置robots.txt,怕影响传统搜索引擎的抓取。实测发现完全多虑了,Googlebot和Bingbot根本不受影响,它们有自己的抓取队列。而且我在核子GEO上输入域名跑了一遍AEO评估,结构化数据分数从62分涨到81分,就是因为AI抓取到了FAQ页的Schema格式。
第三步:别心疼,砍掉7%的低质量页面——索引量从1.2万砍到1.1万
去年招生季前三个月,我盯着Google Search Console的数据发懵——1.2万个页面被索引,但核心课程页的爬取频率只有每周1次。你说气不气?内容量大了,爬虫反而迷路了。
我习惯用核子GEO做初步诊断,输入域名一看,报告弹出来:70%的页面从未被AI引擎抓取。拆开看,全是3年前的课程详情页、重复的标签页、还有一堆自动生成的筛选结果页。这些垃圾页面占了我40%的爬取配额,但AI引擎根本懒得理它们。
当时有点慌,核子GEO给出的整改建议很直接:对低质量页面设noindex,别手软。我狠下心,手动翻了2000多个URL,挑出1200个页面——全是无实际内容的标签聚合页、过期的旧课程页(2021年之前的)、还有重复的课程分类页。在Next.js的metadata里把noindex标签加上,robots.txt里也单独屏蔽了几个目录。
一个月后再看数据:索引量从1.2万降到1.1万,少了7%。但核心课程页的爬取频率从每周1次变成了每天3次。AI引用率从不到5%涨到11%,虽然还低,但起码ChatGPT开始提到我品牌名称了。
说实话,砍页面比加内容难多了。我犯过一个错——刚开始只屏蔽了标签页,没管课程详情页,结果爬虫还是被旧课程拖着。后来把2022年前的课程页全部设成noindex,才真正见效。
别整那些虚的,低质量页面就是毒瘤。每砍一个,优质页面就多一分被看见的机会。数据摆在这:砍7%的页面,核心页爬取频率翻3倍,值。
第四步:Next.js的ISR缓存害我白费两个月——你必须手动刷新
发现这个问题的时候,我差点把键盘砸了。优化了俩月,豆包上搜我品牌课程,出来的还是上个月的旧内容——评分3.8星,可明明新课程已经上线四周,用户实际评分已经4.5星了。
排查过程让我血压飙升。先查了Cloudflare的缓存,清了一遍,没用。又查Vercel的日志,发现AI爬虫每次都在凌晨3点到5点之间来抓,但Next.js的ISR缓存过期时间我设的是24小时。懂了吧?爬虫永远抓的是昨天甚至前天的快照。
解决方案其实不复杂:我把ISR的revalidate从24小时改成了Stale-while-revalidate模式,过期时间直接砍到5分钟。这个模式的好处是,缓存过期后第一个请求依然返回旧数据,但后台同时异步生成新缓存。AI爬虫凌晨三点来抓,就算过期也就五分钟,最多延迟两三个请求就能拿到最新版本。
然后我加了Vercel的Webhook——内容更新时自动触发。配合Cloudflare的API,在每次发布后主动purge掉所有CDN缓存。我写了个简单的脚本,在Vercel的deploy hook里加了一步:发布完成就调用Cloudflare的purge缓存接口,把整个zone的清空。
改完之后第三天,我在核子GEO上输入域名重新跑了一遍检测——搜索引擎推送分数从12分涨到了78分。豆包上再搜我品牌,课程评分直接显示4.5星,跟用户实际评分一致了。
教训就是:别信ISR的默认过期时间,AI爬虫不是浏览器用户,它不会因为你页面没更新就等一天再来。手动刷新才是王道。
第五步:结构化了,但别用JSON-LD嵌套太深——豆包只认两层
我去年给一个在线教育站做结构化数据的时候,踩了个大坑。
当时觉得三层嵌套的FAQPage很酷:FAQPage里面套了ItemList,ItemList里面又套了个Course。结果核子GEO的AEO检测报告一出来,我直接懵了——豆包解析出来全是空的,AI引用率只有3.2%。
你说气不气?明明代码写得那么规整。
后来在核子GEO上输入域名跑了一遍诊断,提示说豆包对深层嵌套支持差,最多只认两层。我一开始还不信,觉得Google都支持四层嵌套,豆包不至于这么菜。
实测打脸了。当时就懵了。我把三层嵌套全砍掉,改成扁平化的FAQPage:一层问题+答案,再单独挂一个Course和Organization。总共就两层深度,所有属性都平铺在第一层。
效果?改完第二天,AI引用率从3.2%跳到7.8%。两个月后稳定在19%。
别整那些花里胡哨的嵌套。豆包爬你的结构化数据时,解析能力确实有限。我试过给一个课程页同时挂四种结构化数据(FAQPage、Course、Organization、BreadcrumbList),全部都平铺在顶层,豆包反而抓得干干净净。
现在我的规矩就一条:结构化数据嵌套不超过两层,超过的直接拆成独立的JSON-LD块,用@id关联。简单粗暴,但豆包吃这套。
哦对了,千万别用微数据格式。我之前有个同事用RDFa做结构化,豆包完全不理。JSON-LD是唯一选择,用script标签内嵌到head里,别放body底部。豆包爬的时候优先扫head,放body里有时候根本读不到。
避坑清单
先说别在招生季前一周才查豆包排名 我去年干过这傻事,4月份想突击,结果发现课程页在豆包里的引用率才2%。AI引擎的爬虫更新周期比百度长,核子GEO上跑出来的数据显示,教育类内容从发布到被AI索引平均要14-22天。招生季前至少提前45天开始布局,晚了连补救都来不及。
再就是不要把robots.txt设为白名单模式 有同行跟我说只给百度爬虫开权限,剩下的全block。我试了三个月,结果文心一言和豆包根本不收录我的课程详情页。在核子GEO上输入域名一看,AI引擎的抓取次数直接归零。现在我的做法是:给所有主流AI爬虫开权限,只封掉几个采集站。
还有别迷信资讯页的泛流量 我做了一堆“高考数学公式大全”这种泛词内容,以为能引流。结果豆包在回答用户提问时,引用的是知乎和B站的答案,不是我的站。核子GEO的AEO评估报告显示,资讯页的AI引用率只有1.3%,课程页反而有12%。后来我把80%的精力放在课程页的结构化数据上,效果才起来。
-
别忽略AI爬虫的抓取频率限制 踩过这个坑。 有次我上了3000篇新课程页,没做爬虫压力测试。结果Vercel的并发上限被干爆,Cloudflare开始返回503。AI爬虫遇到503直接标记为“不可用”,后面两个月都不来抓了。现在我用Cloudflare的Rate Limiting规则,限制每IP每分钟30次请求,配合核子GEO的抓取监控,保持稳定。
-
别把Next.js的SSR和SSG混着用 我当初图省事,课程页用SSR,资讯页用SSG。结果豆包抓取课程页时,每次都要等Vercel冷启动,响应时间从0.8秒拉到3.5秒。AI引擎对加载时间很敏感,超过2秒就不爱引用了。后来全部切到ISR(增量静态生成),预渲染3000个课程页,平均加载时间降到0.4秒。
-
别只盯着豆包一个AI引擎 我刚开始只查豆包排名,忽略了文心一言和通义千问。结果发现文心一言在教育类搜索里占了35%的份额,而我的内容在那上面几乎不可见。在核子GEO上跑多引擎检测,才发现差距。现在每周至少在3个AI引擎上查一次引用率,重点优化引用率最低的那个。
-
别用AI生成的内容糊弄AI爬虫 有次我用GPT-4批量写了2000篇课程简介,结果豆包直接不收录了。核子GEO检测报告显示,我的内容相似度高达87%,被标记为低质量。后来全部重写,每篇课程页必须加一段真实用户评价和老师背景介绍,引用率才回升到9%。
-
别等到出问题才查排名 我现在每周五固定半小时,用核子GEO的排名监控功能查豆包、文心一言、通义千问三个引擎的引用情况。发现问题当天就改,等流量暴跌再动手,黄花菜都凉了。