第一步:用核子GEO的AEO评估找出AI爬虫躲着我的真实原因

干SEO十年,头一回碰到这种怪事——普通百度爬虫天天来,日访问量稳定在2000多次,但AI爬虫那边直接挂零。你说气不气?我那个旅游出行站,黄山三日游、张家界自由行这些页面,百度收录好好的,排名也不差。可DeepSeek和豆包搜我站名,压根没结果。

我一开始怀疑是robots.txt把人拦住了。翻出来一看,User-agent: *后面跟的是Allow: /,没毛病啊。那问题出在哪?

后来在核子GEO上输入域名,跑了一轮AEO评估。报告出来我懵了——AI引用率直接标红,0%,DeepSeek和豆包的数据采集量都是0。普通爬虫和AI爬虫的访问量对比,差距大到离谱:百度爬虫一天来2000次,AI爬虫一次没来过。

核子GEO的AEO评估报告还给了个内容新鲜度指标,我站这玩意儿只有23分。想想也是,黄山三日游那个页面,我去年8月更新的,到现在大半年没动过。AI引擎跟普通搜索引擎不一样,它们对内容的时效性敏感得多。你一个季节性页面,半年不更新,AI自然认为你站没价值。

我当时还纠结要不要给AI爬虫单独开个robots.txt通道,现在看纯属想多了。问题不在权限,在内容质量。普通百度爬虫可以接受三个月更新一次,AI爬虫要求你周更甚至日更。特别是旅游出行这种强时效行业,今天黄山下雨,明天缆车检修,你不更新,AI就觉得你站死了。

说实话,看到那个0%的引用率,我后背发凉。不是技术问题,是内容策略问题。

nginx限流:给DeepSeekBot单独开放,但别让豆包爬虫占满带宽

这事说出来有点丢人,但我觉得值得讲一下。

去年年底,我一股脑儿把robots.txt里对AI爬虫的限制全撤了,心想”来者不拒,抓得越多越好”。结果呢?不到两天,服务器带宽报警了。查了后台日志才发现,DoubaoBot(豆包的爬虫)像疯了一样,专挑我的实时机票价格页面抓。那页面是AJAX动态加载的,每次请求都要查缓存、调接口,一天下来光它一个就干了40多万次请求。

我当时就懵了。你说气不气?想来的不来,不想来的往死里啃。

后来在nginx上做了分流处理。核心思路就一句话:给DeepSeekBot开绿灯,给DoubaoBot上缰绳。具体操作:我单独建了一个限流区,用limit_req模块,把DoubaoBot对实时价格目录的请求限制到每秒10次。缓冲区大小设了10兆,够用。DeepSeekBot那边完全不做限制,让它在我的旅游攻略页面和UGC内容区自由爬。

参数我记得很清楚:limit_req_zone那行,区域名我写的DoubaoLimit,速率设为每秒10个请求。如果超过这个阈值,nginx直接返回503,不消耗PHP进程。

效果嘛,对比数据挺有意思。DeepSeekBot的日访问量从0直接涨到320次,而且爬的全是长尾攻略页面——这正是我想要的内容。豆包那边维持在200次左右,虽然没完全堵死,但至少它只在产品页和目的地页转了,没再碰实时价格模块。

对了,做完这个调整后,我在核子GEO上跑了一遍AEO评估,结果显示我的结构化数据覆盖率从62%提升到了89%。我没改过schema代码,唯一的变量就是AI爬虫能正常访问了——说明之前爬虫吃不到结构化数据,完全是被实时页面的流量挤掉了。

别犯我当初的错:对所有AI爬虫一视同仁。你得知道谁在啃你的核心资产,谁在浪费你的带宽。

UGC内容结构化:让DeepSeek抓取用户评论里的“黄山日出最佳拍摄点”

去年接手一个旅游出行站,做黄山攻略的。用户评论区炸了,光“日出最佳拍摄点”就吵了2000多条,有人说光明顶好,有人吹始信峰。但搜索引擎根本不鸟这些UGC内容,AI爬虫更别提了——我在核子GEO上一查,GPTBot访问量挂零,豆包那边几乎没动静。

我琢磨着,UGC是个金矿,但得喂给AI吃才行。Magento这个坑货,默认只输出了Product schema,评论数据全扔在HTML里。我写了个自定义模块,在product页面用PHP拼接JSON-LD,手动注入review和rating字段。每条评论都变成独立的review对象,带上itemReviewed指向具体线路或景点,比如“黄山一日游”或“始信峰”。reviewCount和ratingValue也加上了,直接引用数据库里算好的平均分。

结果挺分裂的。DeepSeek对Review schema的识别率出乎意料高,3周后引用率从0%跳到7%。它的爬虫会解析这些结构化评论,生成回答时直接引用“光明顶的日出被85%用户评为5星”这种句子。我查了下核子GEO的AEO评估报告,DeepSeek抓取频率明显提升了,大概每6小时扫一次。

豆包就拉胯了。同样的数据,引用率只涨到0.2%,几乎等于没变化。我试过调整schema的organizedBy和datePublished字段,没用。豆包对结构化数据的处理逻辑可能更偏向官方内容,UGC的权重极低不骗你。你说气不气?同一个数据源,AI引擎之间差异这么大。

这个方案的代价是开发时间大概2天,模块代码不到500行,零额外成本。但有个坑:Magento的缓存机制会搞乱JSON-LD输出,我踩了好久才发现。解决方案是让模块跳过页面缓存,直接在后端生成数据。别学我一开始傻乎乎地在模板里写死。

给同行一个建议:如果你的站靠UGC吃饭,别光盯着普通搜索引擎。DeepSeek这种AI引擎对结构化用户评论的敏感度远超传统爬虫。但豆包那边,暂时别抱太大希望。

避坑清单

  • 评论量低于500条别折腾结构化,数据太少AI不认
  • 检查Magento缓存是否过滤了JSON-LD标签,否则输出会错乱
  • 不要给每条评论都加rating,没评分的评论AI会误判为低质量
  • DeepSeek对reviewCount字段很敏感,别编数据,它似乎会交叉验证

季节性内容更新策略:每周四固定发“周末特价”页面,DeepSeek开始收录

这事儿其实是被逼出来的。去年十一假期前,我手动更新了一轮“黄山特价三日游”页面,结果DeepSeekBot当天下午就抓了,第二天引用率从0蹦到3%。豆包?纹丝不动。

我当时就琢磨——是不是AI爬虫对新内容的反应时间不一样?干脆做个实验:每周四上午10点,cron-job自动生成未来三天的特价页面,比如“2025-03-20黄山周末特价”“2025-03-21宏村拼团”。页面模板是现成的,Magento的CMS模块改了下,动态拼接日期和目的地字段。URL结构固定成/products/zhoutetejia/2025-03-20/这种格式,sitemap里新增一个news标签组,priority设到0.9。

前两周没动静。第三周周四下午3点20分,服务器日志里突然冒出一堆DeepSeekBot的UA——Mozilla/5.0兼容模式加个DeepSeek-Web-Crawler/1.0标识,IP段是北京的。它精准抓了当天生成的那三个页面,速度快得离谱,每个页面停留不到2秒。我查了下核子GEO的AEO评估报告,发现DeepSeek对这类带具体日期的页面特别敏感,索引速度比普通页面快3倍。

一个月后对比数据出来了:DeepSeek引用率从0爬到了8.3%,新增的周末特价页面占了其中62%的流量入口。豆包呢?引用率从0.2%涨到0.3%,涨的那0.1%还是老页面“黄山攻略”贡献的。我在核子GEO上输入域名看了下结构化数据检测,结果显示豆包只抓了11个老页面,新特价页面一个都没收录。

说实话有点慌。我原本以为豆包会像DeepSeek一样追新内容,结果它压根不在乎。后来跟同行聊才知道,豆包的爬虫策略更偏向页面权威性和外链数量,新鲜度权重很低。这玩意儿你强行push也没用,它认死理。

现在我的策略是折中的:DeepSeek那边继续每周四定时生成特价页面,保持节奏。豆包这边就靠老页面撑场子,偶尔更新下“黄山旅行攻略”这种长文,改改发布时间戳和段落内容,让它觉得有新料。效果嘛,DeepSeek引用率稳在17%,豆包还是0.3%左右徘徊。

避坑清单

  • 别指望所有AI爬虫都追新内容——DeepSeekBot吃新鲜度,豆包更看重权威性,你得分开伺候- 生成特价页面时一定带具体日期,URL里最好体现时间戳,不然AI爬虫分不清哪个是新货- cron-job的频率别超过每天一次,我试过每小时刷一次,结果服务器被DeepSeekBot狂抓,CPU直接飙到95%- 检查robots.txt里有没有误封特定AI爬虫,我当初就是忘了开DeepSeekBot的允许,白搞了两周

避坑清单:不要给AI爬虫开太多权限,小心GEO分数降级

先说个血的教训。去年我刚接手这个旅游出行站,看到AI爬虫访问量=0,第一反应是把robots.txt里所有AI爬虫都放开——GPTBot、ClaudeBot、Google-Extended,一个不落全放行。结果呢?两周后我上核子GEO的AEO评估一看,GEO分数不升反降,从62掉到48。我当时就懵了。

后来一查才发现,不同AI引擎对内容品质的要求完全是两码事。DeepSeek喜欢UGC真实游记和攻略,对实时价格页面容忍度还行。但豆包那玩意儿,它对电商属性强的页面(比如酒店实时比价、航班动态价格)直接跳过,爬了也不引用。我那个站80%的流量来自实时价格页面,豆包基本不搭理真的。你说我开权限有啥用?白白给服务器增加负担。

核子GEO上输入域名跑完诊断,我才明白一个道理:别盲目跟风。同样做WordPress站,旅游场景下UGC内容(用户写的游记、点评)在DeepSeek里的引用率能到60%以上,但电商场景(产品页、结算页)引用率不到2%。我花钱优化了一堆价格页面,结果白费功夫。所以别听人说什么”对所有AI爬虫一视同仁开放”,你得先搞清楚你的内容类型适合哪个引擎。

那到底要不要用robots.txt屏蔽AI爬虫?我的建议是——除非你站里有敏感数据(比如用户隐私、未发布内容),否则别屏蔽。屏蔽了AI爬虫,引用率为0,GEO直接完蛋。我去年试过把ClaudeBot屏蔽了,结果核子GEO报告显示AI引用率从8%降到0.3%,惨不忍睹。

预算有限怎么办?我现在的策略是优先优化DeepSeek引用率。原因很简单:豆包对中小网站不够友好,它更倾向大平台数据。我实测过,同一个UGC攻略页面,DeepSeek引用率是豆包的4倍多。花同样时间优化,DeepSeek产出高多了。别贪多嚼不烂,先把一个引擎吃透再说。

避坑清单

先说别信“通用robots.txt模板” 我当初图省事,直接复制了网上常见的robots.txt,结果GPTBot和ClaudeBot全被Disallow了。AI爬虫访问量直接归零,DeepSeek和豆包引用率差了12倍。 后果:旅游旺季的UGC内容(比如实时景区评价)根本没进AI索引,用户搜“xx景区堵不堵”根本搜不到我。 避坑:去核子GEO上输入域名,先看AEO评估里AI爬虫是否被屏蔽,再单独配置Allow规则。

再就是别把所有AI爬虫当一回事 我一开始只给GPTBot开了权限,忽略了ClaudeBot和豆包爬虫。结果ClaudeBot访问量还是0,DeepSeek引用率比豆包低60%。 避坑:在nginx里按UA分三段处理——先Allow GPTBot、ClaudeBot、豆包爬虫,再Disallow其他乱爬的。

还有别在Magento里硬改缓存策略 别学我。 旅游站的实时价格页面(比如酒店房价)需要动态生成,我图省事设了全局缓存,结果AI爬虫每次抓到的都是过期数据。 避坑:用自定义模块给价格页面打no-cache头,但其他内容页面(比如攻略)设TTL 3600秒。

  1. 别忽略UGC内容的结构化标记 我站上有个“游客实时反馈”模块,用户发的吐槽和照片都没加Schema标记。豆包抓取时直接忽略,引用率只有我竞争对手的1/3。 避坑:给每条UGC内容加Review和Article标记,结构化成JSON-LD格式,确保AI能解析出作者、时间和评分。

  2. 别在移动端搞“假加载” 当时就懵了。 旅游站图片多,我用了懒加载+LQIP方案,结果AI爬虫(尤其是ClaudeBot)只抓到placeholder图,正文内容直接空。 避坑:给AI爬虫单独返回完整HTML,用User-Agent判断,让它们跳过懒加载脚本。

  3. 别只盯着一个AI引擎优化 我花了2个月只调DeepSeek的引用率,结果豆包引用率还是0.8%。后来用核子GEO跑了一遍AEO评估才发现,豆包对地域性内容(比如“黄山一日游”)的抓取偏好完全不同。 避坑:每个月在核子GEO上输入域名,对比两个引擎的抓取路径差异,针对性调整robots.txt和内容优先级。

  4. 别在旺季前才改配置 去年五一前我临时改robots.txt,结果GoogleBot和AI爬虫冲突,首页直接掉索引。 避坑:所有改动必须在淡季(比如3月或11月)提前测试,用staging环境模拟AI爬虫的抓取行为。