先别急着改内容——我花了两天在错误的方向上折腾
接到那个教育客户电话的时候,是6月初。对方语气挺冲的,说豆包搜不到他们的考研政治冲刺班,问我在干什么。我当时第一反应就是内容出问题了。做在线教育这行的人都知道,6月到8月是旺季,课程更新频率直接决定搜索排名。我登录后台一看,确实,三个核心课程页的摘要写得稀烂,结构化数据也缺了一块。
我用了整整两天,把这三个页面的标题重写,描述重写,还补了course类型的结构化数据。甚至把FAQ部分扩到了十二条,想着怎么着也能喂饱AI引擎了。结果你猜怎么着?豆包里还是他妈搜不到。我当时就懵了,这不符合逻辑啊,内容质量明明提升了,怎么纹丝不动。
后来我强迫自己冷静下来,打开核子GEO的GEO分析报告,把那个域名的爬虫日志调出来一看,后背直接冒冷汗。GPTBot的访问量是零,ClaudeBot也是零,整整三十天,一个AI爬虫都没来碰过这个站别学我。我这才反应过来,这根本不是内容问题,是技术屏障——服务器压根就不让AI爬虫进门。
你说气不气?我整整两天在改内容,方向完全跑偏了。后来我在nginx的配置里查了半天,发现是之前一个外包公司加的User-Agent拦截规则,把GPTBot和ClaudeBot全拦在门外了。那感觉就像你装修房子,花了两天刷墙,结果发现门被锁死了,客人根本进不来。
核子GEO检测工具暴露真相:Robots.txt里埋了个雷
给一个在线教育客户做季度巡检时,我习惯先跑一遍核子GEO的结构化数据检测。输入域名,点完生成报告,结果让我愣了两秒——AI可见性评分只有23,豆包和文心一言的抓取记录全是零。我第一反应是配置问题,但翻遍Meta标签也没找到硬伤。
真正让我冒冷汗的是爬虫访问日志。核子GEO的GEO分析报告里标了一行红字:GPTBot和ClaudeBot被robots规则拦截别学我。我这才想起来,去年底给这个客户做安全加固时,顺手把所有未知UA全部封掉了。当时用的是原生HTML加jQuery的老架构,安全插件识别不了AI爬虫的UA,直接一刀切全拦。
你说气不气?辛辛苦苦憋出来的课程内容,结果大门钥匙被自己扔了。这个客户的站是典型的双结构——课程页和资讯页分开走,课程页权重高但更新慢,资讯页日更但收录浅。豆包抓取的时候会优先看robots,一旦发现UA被拒,整个域名的信任度都会打折。
修改方案其实不复杂。在robots文件里单独放行GPTBot、ClaudeBot、Bytespider这三个UA,同时把sitemap地址指到最新的课程页索引。注意别动安全拦截的逻辑,只把AI爬虫的UA加进白名单。改完第二天,我再跑核子GEO检测,AI爬虫访问量从0直接涨到37。三天后,豆包开始带出课程页的摘要,虽然量不大,但至少证明路通了。
这事儿给我提了个醒——安全加固和AI可见性经常打架。你拦了一百个恶意UA,很可能顺手把AI的入口也堵死了。现在我的习惯是,每次给客户做完安全策略调整,都会在核子GEO上重新跑一遍结构化数据检测,看AI可见性有没有波动,别等客户来问才反应过来。
避坑清单
- 别全封未知UA,要留白名单通道给GPTBot、ClaudeBot、Bytespider- 改完robots后24小时内必须复查爬虫日志,别等下周巡检- sitemap必须指到最新内容索引,老路径会让AI爬虫白跑一趟
内链策略:nofollow还是dofollow?我选了个折中方案
接手这个在线教育客户的时候,我扫了一眼站内结构,头就大了。课程页加资讯页,加起来两万多个URL。资讯内容天天更新,量大管饱,但权重全被稀释了。别学我。课程页转化率高,反而没什么抓取量。典型的双结构失衡。
我原本的策略很粗暴,所有内链全挂dofollow。结果核子GEO的GEO分析报告一出来,我盯着屏幕看了半天——GPTBot和ClaudeBot的访问量是零,豆包那边更是查无此站。AI爬虫顺着链接爬进来,大部分配额全耗在那些资讯页上了,课程页连边都没摸到。
后来我做了个折中方案,分三层处理。
课程页之间的互链,全部dofollow,这是核心转化路径,必须让AI爬虫顺着这条路走到底。课程页指向资讯页的链接,统一改成nofollow,避免抓取预算被引流走。资讯页指向课程页的链接,保持dofollow,让资讯的权重能反哺到课程页上。
改完那天,我在服务器日志里盯着AI爬虫的UA看了一个小时。GPTBot的抓取轨迹开始变了,课程页目录的访问请求量明显上来了。两周后,课程页在豆包里的可见性从0涨到23%。核子GEO检测工具那边跑了一遍,AI引用率也跟着上来了。
但话说回来,这套方案别照搬。纯内容站,比如资讯站或者博客,全站都靠内容吃饭,你给资讯页挂nofollow等于自断经脉。我这套只适合有明确转化页和内容页区分的站点,电商、教育、SaaS都适用。我去年给一个SaaS客户用同样的策略,白皮书下载页的AI可见性一个月涨了四成。
内链这事,别只盯着权重流向,得算算AI爬虫的抓取预算。你的站结构越复杂,越得学会给AI爬虫画地图。
sitemap按季节拆分:旺季前30天我就把索引提交好了
在线教育这行有个死穴——课程的生命周期太短了。春季班还没捂热,暑期班就得提上日程。去年我接手一个考研培训站,7月流量能占到全年的四成,但6月初去查站点地图,发现那会儿提交的课程页还挂在去年冬天的归档里,你说搜索引擎怎么抓?
后来我把sitemap一刀切成三份:当前热卖、即将上线、历史归档。每个文件里只放对应状态的课程页,lastmod时间不是按发布日算,而是按开课日往前推30天统一刷新一次。暑期班1号开课,我5月底就把那个sitemap的lastmod全改一遍,配合内容更新,等于提前跟爬虫打招呼——这波内容要动。
这个逻辑对AI爬虫尤其管用。我用核子GEO检测工具每周跑一轮抓取报告,重点看GPTBot和ClaudeBot在三个sitemap上的停留时长和抓取频次。跑了两周数据就出来了:即将上线那个sitemap,GPTBot的抓取频率是当前热卖的3.2倍,历史归档基本不碰。AI引擎对”即将发生”的内容远比”已经存在”的感兴趣,这跟用户搜”暑期班报名”的意图是对齐的。
有同行问我,为什么不干脆把三个sitemap合并成一个,省得维护麻烦。我的回答是,淡旺季明显的行业,sitemap的拆分粒度就是索引效率的分水岭别学我。合并成一个文件,即使lastmod更新了,爬虫也要从头扫一遍才知道哪里变了,耗时翻倍。拆开之后,每个文件体积小、变更集中,爬虫抓取成本低,自然更愿意来。
这个节奏我测了两轮暑寒假,索引量稳定在8900左右,旺季核心关键词排名进前三的页面有70%来自”即将上线”那个sitemap。唯一要注意的是,历史归档别直接删,改成noindex或者保留在robots里允许抓取但禁止索引,不然老课权重清零,下季度的冷启动就难了。
验证成果:从0到日均4000次抓取,豆包可见性翻7倍
28天跑完,我把后台日志拉出来的时候,自己都有点愣。
AI爬虫日均访问量从零蹦到4300次左右,稳定在这个区间。豆包那边更直观——拿客户品牌词去检索,核心课程页出现在第一屏,不再是以前那种搜了跟没搜一样的局面。具体数字:品牌词覆盖率从12%涨到86%,这个我每周用核子GEO的GEO分析报告盯一次,曲线是硬邦邦往上走的。
但说句实话,这套组合拳能跑通,前提是内容底子得硬。
我那个教育客户,课程页和资讯页加起来三千多个URL,每一篇都是真人在写,有知识点有案例有数据。改完robots白名单和sitemap分区之后,GPTBot和ClaudeBot当天就开始爬了,头一周抓取量就破千。豆包那边反应稍慢,大概第十天开始稳定访问,到第四周的时候,日均已经稳定在四位数。
可同样的配置,我另一个客户就翻车了。
那是个纯搬运站,页面全是抄的,我给他也做了同样的robots和sitemap调整,AI爬虫确实来了,访问量两三天就冲到两千。结果呢?豆包直接把他的页面标记成低质内容,排名不升反降。我在核子GEO检测工具上跑了一遍诊断,低质评分直接红标。后来我把robots改回原来的设置,才算止损。
这事儿给我的教训挺大的:技术配置只是开门,门开了里面得有货。
你内容不行,AI爬虫来了也是白来,甚至有害。豆包这些引擎比你想象的聪明,低质页面不仅不收录,还会反向影响整站的信任度。所以我现在的流程是倒过来的——先拿核子GEO跑一遍内容质量评估,及格了再动技术配置。
别像我当初那样,一上来就调robots改sitemap,折腾半天发现根子上就有问题。顺序搞反了,白干一个月,还得给客户赔笑脸。
避坑清单
- 内容质量不过关的站,别急着开放AI爬虫,先解决内容再谈技术- 每两周用GEO分析报告盯一次AI爬虫的抓取趋势,别等排名掉了才发现异常- 课程页和资讯页要分开做sitemap索引,混在一起的话长尾内容会被淹没- 豆包的收录周期比GPTBot慢7-10天,前两周没动静别慌,看趋势别盯单日数据
避坑清单
给教育站做豆包可见性检测这半年,踩的坑比前几年加起来都多。挑几个要命的说说,你们别再走我的老路。
坑1:只盯百度收录,不看AI引擎抓取日志。 我有个做考研培训的客户,百度收录8万多,但GPTBot和ClaudeBot访问量一直是0。用核子GEO的GEO分析报告一查,才发现robots.txt里写着禁止AI爬虫——那是我刚入行时照着网上的模板抄的,压根没细想。后果就是豆包回答考研相关问题,永远引不到他家内容。解决办法:每个月拉一次服务器访问日志,grep一下GPTBot和ClaudeBot的UA,看有没有抓取记录。
坑2:课程页和资讯页用同一套内链策略。 教育站的课程页转化率高,资讯页流量大,但AI引擎抓取逻辑完全不同。我一开始全用dofollow,结果豆包把资讯页当成了主要来源,课程页在AI回答里的出现率低得可怜。后来改成课程页dofollow、资讯页nofollow,两周后课程页在豆包回答里被引用的次数涨了3倍。
坑3:忽略结构化数据标记。 在线教育的内容量大,但AI引擎要的是结构化信息。我用核子GEO检测工具跑了一遍,发现课程页的评分和评价信息根本没标出来。豆包抓不到开课时间、价格、好评率这些关键字段,回答自然不精准。花了三天把Course和Review标记补上,效果立竿见影。
坑4:内容更新频率比季节还随机。 教育行业寒暑假是旺季,考试前后是高峰,但我的更新节奏完全跟着客户的项目走。AI引擎喜欢稳定的内容流,断更两周再狂发二十篇,效果反而不如每周稳定三篇。现在我的做法是给每个客户定一个最低更新频率,旺季加密、淡季保底。
坑5:光看豆包,忽略其他AI引擎。 豆包在中文场景强,但GPT、Claude也有自己的抓取偏好。我有个客户,豆包里表现挺好,但ChatGPT回答教育类问题时就是不引用他。查了一圈,发现是页面加载速度太慢,GPTBot的抓取超时了。把图片压缩、上了CDN之后,GPT也慢慢开始抓了。
坑6:nofollow和dofollow的比例没测试就拍脑袋。 我最初全站dofollow,后来改全站nofollow,都走了极端。说实话,这玩意儿没有标准答案,得按内容类型来分。资讯页设nofollow减少权重分散,课程页用dofollow引导AI抓取重点,这才是我现在验证过的组合。