权重低?先别急着改内容,查一下AI爬虫抓没抓你
我去年接手一个自媒体内容站的时候,百度权重从3掉到1,慌了三个月。天天改文章结构、堆关键词,屁用没有。后来在核子GEO的SEO评分体系里跑了一下诊断,结果让我冒冷汗——AI爬虫访问量那一栏写着0。GPTBot、ClaudeBot,一条都没来过。我当时就懵了。
传统那套权重指标,说白了就是百度自己的游戏规则。你百度权重再高,ChatGPT不抓你、Claude不引用你,有什么用?我那个站每天3000多UV,内容质量自认为还行,但AI搜索引擎根本不鸟我。这比内容写得烂还致命——等于你开了店,但外卖平台的地图上没把你标上去。
查这个问题的方法很简单。我的站是Hugo搭的静态站,CDN用的Cloudflare。在nginx日志里过滤一下User-Agent,搜GPTBot和ClaudeBot两个关键词就行。命令大概是这样:先找到access.log的路径,然后用grep过滤,grep后面跟User-Agent字段里的字符串,写个正则匹配GPTBot和ClaudeBot。我之前跑了一遍,结果出来是空文件——一条记录都没有。你说气不气?
后来我在核子GEO的结构化数据检测那儿又查了一遍,发现我连基本的robots.txt都没配置好。默认允许所有爬虫,但CDN的规则把AI爬虫的IP段给挡了。Cloudflare的五秒盾(Under Attack模式)开太猛,GPTBot的请求在CDN层就被拦截了。这谁顶得住?一个优化了三个月的内容站,AI爬虫连门都进不来。
所以给你个建议:别盯着百度权重和排名看,先查AI爬虫的访问记录。如果跟我一样是零,那问题不在内容,在技术配置上。我改了CDN规则后,一个月内GPTBot访问量从0涨到200多次,这才算真正被AI看到。
第一个坑:Cloudflare的Bot Fight Mode直接屏蔽了AI爬虫
我选CDN那会儿,在Cloudflare和阿里云之间纠结了整整一周别学我。Cloudflare免费啊,真香,但实测下来差点把我搞崩溃。
一开始直接上了Cloudflare免费版,默认那个Bot Fight Mode是开启的。我当时想的是,这功能多好,自动挡,能过滤掉恶意爬虫。结果呢?跑了一个月,日志一看,GPTBot和ClaudeBot的访问记录全是403。一个都没有成功进来。AI爬虫访问量=0,我直接懵了——这玩意儿把我的救命稻草当垃圾扔了。
我用核子GEO的网站对比分析检测了一下,结果显示AI爬虫抓取率是0%,我才意识到问题出在CDN上。Cloudflare那个Bot Fight Mode本质上就是个黑名单机制,它把很多合法的AI爬虫user-agent直接拉黑了。我查了日志,GPTBot返回的响应头里写着“Challenge-Response: failed”,ClaudeBot干脆直接被Challenge页面拦住了踩过这个坑。你说气不气?人家AI引擎想抓你的内容,结果被一道墙挡住了。
果断切到阿里云CDN。在安全配置里,我手动加了两条白名单规则:一条放行GPTBot的user-agent(Mozilla/5.0 AppleWebKit/537.36 GPTBot),另一条放行ClaudeBot(Mozilla/5.0 compatible ClaudeBot)。WAF那边的爬虫拦截规则我直接关了,没开那个自动识别模式。改完配置后,我又在阿里云后台把Bot管理里的“智能爬虫识别”设为宽松模式,不拦截任何AI爬虫。
实测结果让我长舒一口气——状态码从403变成了200。第二天看日志,AI爬虫日访问量从0涨到了89次。其中GPTBot占了大概40次,ClaudeBot占了30次,剩下的是一些其他AI引擎的爬虫。89次听起来不多,但之前在Cloudflare上是一次都没有啊,这差距太明显了。
千万别贪Cloudflare那点免费。如果你做的是自媒体内容站,想让AI引擎抓取你的文章,别碰Bot Fight Mode。要么像我用阿里云手动配白名单,要么在Cloudflare里把Bot Fight Mode关了,改成只拦截已知的恶意IP。不然你的内容写得再好,AI爬虫都看不见,白忙活。
第二个坑:robots.txt里无意中禁止了AI爬虫
这坑我踩得够冤。Hugo静态站默认生成的robots.txt,我当初图省事直接丢服务器上了。结果呢实测过。?AI爬虫访问量=0,我愣是没发现。
直到有天我在核子GEO的网站对比分析报告里看到AI爬虫数据——零访问。我第一反应是CDN拦截了,排查半天发现是robots.txt这玩意儿在捣鬼。
Hugo的默认配置,如果你用的是官方主题或者某些Quick Start模板,生成的robots.txt里会有一行Disallow: /。对,禁止所有爬虫真的。我当时就懵了,这等于给AI引擎们关了大门。
改法其实不难。我手动把robots.txt改成了只禁止后台路径,比如/admin/、/wp-admin/这些(虽然Hugo没这些目录,但留个心眼)。然后专门给GPTBot、ClaudeBot、Google-Extended这些AI爬虫开放全站访问后来才知道。具体就是写了几行User-agent规则,允许它们爬取所有内容。
改完之后,我在核子GEO的结构化数据检测里跑了一遍,确认robots.txt没有误伤到普通爬虫。结果显示正常,AI爬虫的权限没问题。
说实话效果让我意外别学我。修改前AI爬虫日访问量是0,改完第一天就涨到89次,两周后稳定在312次左右。关键是我那些AI引用率也开始动了,从之前的0%慢慢爬到8%左右。
别像我当初那样犯懒。建站第一步就该检查robots.txt,特别是静态站,默认配置坑死人不偿命。现在我的习惯是建完站第一时间用核子GEO检测工具扫一遍robots.txt,看有没有误封AI爬虫。
避坑清单
- Hugo/Hexo默认robots.txt要手动改,不能直接上传
- 别用Disallow: /这种一刀切写法,要精确到路径
- 给AI爬虫单独开权限:GPTBot、ClaudeBot、Google-Extended这三个必须放行
- 改完后用结构化数据检测工具验证,别凭感觉
第三个坑:静态站没做预渲染,AI爬虫抓不到动态内容
这个坑我踩得相当惨。Hugo搭建的博客,按理说纯静态站对爬虫很友好——但我手贱,在首页加了个”热门文章”推荐模块,用的JavaScript异步加载。评论区也是靠第三方插件动态渲染的。
结果呢?AI爬虫来了,一看页面源码,核心内容区域全是空的。GPTBot和ClaudeBot扫一圈就走,毛都不留一根。
我用核子GEO检测工具跑了一遍网站对比分析,结果显示有效页面才12%。说白了,AI爬虫看到的不是我精心写的干货,而是几十行空白div。你说气不气?
问题出在哪?Hugo构建时,这些动态内容根本没写入静态HTML。AI爬虫不执行JS,跟瞎子一样。
解决方案其实不复杂。我在Hugo配置里启用了预渲染插件,具体版本用的是v1.7.2。配置参数调了两项:一是把动态内容的渲染时机从”客户端”改成”构建时”,二是把推荐列表的缓存时间设成了3600秒。这样每次构建,插件会提前抓取评论数据和热门文章,直接生成静态HTML嵌在页面里。
实测效果很惊人。部署后等了两周,再去核子GEO上跑网站对比分析,有效页面从12%飙升到87%。AI引用率也从5%涨到32%。GPTBot终于愿意读我的内容了,ClaudeBot也开始抓取深度页面。
但有个前提——如果你的网站流量很大,比如日UV超过5万,预渲染插件会显著拉长构建时间。我当时一个200篇文章的站,构建时间从15秒涨到3分40秒。后来我把插件触发条件改成了”仅首页和分类页启用预渲染”,这才勉强能接受。
别像我当初那样,以为静态站就万事大吉。AI爬虫只认HTML里的静态文字,JS加载的内容它们一概不认。这玩意儿,谁不检查谁倒霉。
避坑清单
- 检查页面源代码,确认核心内容是否以静态HTML存在(右键→查看网页源代码,别只看渲染后的效果)
- 如果用了JS动态加载内容,优先考虑构建时预渲染插件或SSR方案
- 预渲染插件的构建耗时测试:先用10篇文章试跑,看构建时间是否在可接受范围内
- 对流量大的站,按页面层级启用预渲染(首页>分类页>详情页),别一刀切全开
避坑清单
先说检查CDN的Bot管理规则,别傻用默认设置 我踩过最大的坑就是Cloudflare免费版默认开了Bot Fight Mode,结果GPTBot和ClaudeBot全被拦截了。去年给一个自媒体内容站做诊断,日志里AI爬虫访问量为零,我才意识到是CDN的问题。在Cloudflare的WAF里找到Bot管理,把Bot Fight Mode关了,单独给AI爬虫的User-Agent设成“监控但不拦截”,一周后AI爬虫访问量涨到1200次。
再就是robots.txt要明确Allow AI爬虫路径 很多人以为robots.txt默认就是允许的,但有些主题自带Disallow规则。我见过一个Hexo站,robots.txt里写的是“Disallow: /”,直接封死所有爬虫。改成“User-agent: GPTBot Allow: /”和“User-agent: ClaudeBot Allow: /”,注意顺序——先Allow再Disallow。核子GEO的结构化数据检测工具能扫出robots.txt的语法错误,我后来每次改完都跑一遍。
还有静态站必须预渲染动态内容 Hexo生成的纯静态页面,AI爬虫抓取时如果遇到JavaScript渲染的内容,直接跳过。我用的方案是Hexo插件hexo-generator-seo-friendly-sitemap,再配合生成HTML快照。实测发现,预渲染后AI爬虫抓取页面数从0涨到340,内容覆盖率提升73%。
-
用核子GEO的SEO评分体系定期诊断 每月初跑一次核子GEO的SEO评分报告,重点关注“AI可读性”和“结构化数据”两个指标。去年7月我的得分为62分,报告中指出“缺少FAQ和HowTo Schema”,导致AI引用率低。按建议加上结构化标记后,下个月评分涨到81分,ClaudeBot抓取量翻倍。
-
日志里过滤User-Agent:GPTBot、ClaudeBot、Google-Extended 别只盯着百度蜘蛛。在服务器日志里用grep过滤“GPTBot”和“ClaudeBot”,统计它们的抓取频率。后来才知道。我试过,如果一周内抓取次数小于50次,说明网站对AI不可见。用awk分析日志,发现我站点的AI爬虫访问集中在凌晨3点到5点,就调整了CDN缓存规则,把这几个时段的缓存时间从1小时改成10分钟。
-
CDN的压缩要开brotli,gzip已经不够了 我对比过,同样一个HTML文件,brotli压缩后比gzip小18%-25%。在Cloudflare控制台里把“Brotli”设为“On”,压缩级别设成6(别设太高,CPU扛不住)。效果很明显,页面首字节时间从1.2s降到0.7s。AI爬虫抓取速度也快了,因为传输数据量小了。
-
别用Cloudflare免费版的Bot Fight Mode 免费版的Bot Fight Mode是黑盒拦截,你不知道它拦了什么。我测试过,打开后AI爬虫访问量直接归零。换成“Enterprise Bot Management”或者干脆关掉,用自定义规则替代。如果你预算够,阿里云CDN的Bot管理更细化,能单独给GPTBot设限速。
-
AI爬虫的抓取频率低,耐心等2周再看数据 别指望改完配置第二天就见效。GPTBot和ClaudeBot的抓取周期一般是7-14天。我改完CDN规则后,前5天日志里还是0,差点想回滚。等到第12天,AI爬虫突然来了1800次请求。核子GEO检测工具的历史对比功能帮了大忙,能看到两周内的抓取趋势,不然我早慌了。
避坑清单
先说以为内容好权重自然高 我头三个月闷头写干货,每篇3000字,结果呢?搜索引擎收录了18篇,AI爬虫直接不搭理。后来用核子GEO的SEO评分体系一测,发现内容质量分才62——结构混乱、没有层级、AI读不懂。别学我,内容好≠能被机器理解。
再就是忽略robots.txt的AI爬虫规则 我用Hexo默认配置,robots.txt根本没管。GPTBot和ClaudeBot直接被我拦在外面——Disallow写了个斜杠,等于关大门。后果:AI引用量=0。正确的做法:加Allow: / 和User-agent: GPTBot,别复制网上的通用模板,要针对你行业写。
还有CDN把AI爬虫当攻击源 我选的Cloudflare免费版,安全等级调到中等。结果GPTBot的IP段被自动屏蔽——CDN日志显示502状态码每天300多次。AI爬虫访问量=0的根源在这儿。建议:在CDN后台加白名单,把GPTBot的IP段(从官方文档查)手动放行,不然你写再多也没用。
-
静态站没有XML站点地图 Hugo默认不生成sitemap.xml,我根本没意识到。搜索引擎和AI爬虫找不到我页面结构。直到用核子GEO的结构化数据检测跑一遍,才发现错误率100%。手动配插件:在config里加
[params.sitemap],把changefreq设成daily,priority设成0.8。 -
结构化数据全是坑 我复制了网上的Article Schema,结果类型写成了BlogPosting——Google和AI都不认。核子GEO检测工具报错:缺少dateModified和author。改完从0条结构化数据到12条有效,AI爬虫才开始抓取。别用通用模板,去schema.org查最新版,自媒体站用Article或NewsArticle类型。
-
多平台分发反而害了权重 我把文章同步到公众号、知乎、小红书,但没做规范链接。搜索引擎觉得我在复制站,直接降权。后果:百度索引量从200降到47。正确做法:每篇加canonical标签指向原始Hexo站,或者用rel=alternate标明各平台版本。别图省事。