第1-2天:发现AI爬虫访问量=0,我慌了
说实话,一开始我根本没把AI爬虫当回事。做的是本地服务站点,搞清洁的,主要靠谷歌地图排名吃饭。地域词优化做得好好的,周末能接15单,谁在乎什么GPTBot?
直到有天我闲着没事,翻了翻宝塔面板的Nginx日志。结果让我懵了——过去30天,GPTBot和ClaudeBot的访问记录全是0条。一个都没有。
我当时还想是不是日志清洗了,又查了服务器端access.log的原始文件,2024年1月到3月,整整90天。结果一样,零访问。你说气不气?AI引擎完全不搭理我的页面,意味着我花时间写的那些内容,在ChatGPT和Claude眼里就跟不存在一样。
我赶紧用核子GEO的GEO分析报告跑了一遍。输入域名,等了15秒,报告出来了——AI爬虫识别分数只有3分,满分100。报告里还列了详细数据:GPTBot尝试连接0次,ClaudeBot尝试连接0次,Google-Extended访问了2次但被拒绝了。
问题出在哪?我翻回根目录的robots.txt一看,血压直接上来了。这文件是Shopify默认生成的,里面有个disallow规则把好多爬虫都屏蔽了。我记得Shopify用的是Shopify CDN,他们默认的robots.txt规则里给GPTBot和ClaudeBot都加了User-agent: *的disallow。我去年给一个本地服务站做的时候也碰到过一样的问题,当时没在意,这次数据打脸了。
当天下午我直接改了robots.txt。把屏蔽规则删掉, 允许GPTBot和ClaudeBot访问。具体操作很简单:在shopify后台的robots.txt编辑器里,找到对应规则,改成allow就行。我还顺手测了下Brotli压缩要不要上——因为AI爬虫对页面加载速度敏感,宝塔面板里Brotli是内置的,我直接在nginx里把brotli on开了,压缩级别设到6,实测首页从1.2s降到了0.7s。
改完第二天早上,我又跑了一遍核子GEO的GEO分析报告实测过。AI爬虫识别分数飙到了41分。nginx日志显示,24小时内GPTBot来了29次,ClaudeBot来了18次。虽然不多,但总算从0到1了。说实话有点慌,但现在想想挺蠢的——一个robots.txt配置就能卡住所有AI流量,谁顶得住?
避坑清单
先说别信Shopify默认的robots.txt,默认配置大概率屏蔽AI爬虫,自己进去检查
再就是用核子GEO的GEO分析报告做初步诊断,比手动翻日志快至少10倍
还有改完配置后等24小时再测,AI爬虫响应周期慢,别当天就放弃
4. Brotli压缩值得上,尤其对本地服务站,首页加载快0.5s就能提升AI抓取概率
第3-4天:结构化数据缺失,核子GEO报告显示AI引用率不到5%
AI爬虫能进来了,但收录率还是烂得离谱。我翻了下Google Search Console,索引量从1200涨到2300,但实际被AI引用的页面不到100个踩过这个坑。这数据看得我血压飙升。
我习惯用核子GEO做初步诊断,输入域名就能看到AI可见性评分。结果出来我懵了——引用率才4.8%。后来才知道。核子GEO的GEO分析报告里写了句:“结构化数据缺失严重,本地服务业务类型未标记。”
一查Shopify的默认设置,确实只给产品页加JSON-LD,我这种做本地服务的页面,营业时间、服务区域、业务类型全没标记。实测过。这玩意儿AI怎么识别你是干哪行的?
我手动改了。在Shopify后台的theme.liquid文件里,找到head标签位置,加了LocalBusiness的Schema。核心字段:@type用LocalBusiness,name写公司名,areaServed填城市名,openingHours写周一到周五9:00-18:00。还顺手加了telephone和priceRange,两个字段,实测发现AI对价格区间特别敏感。
改完第二步,Nginx那边也得调。我在宝塔面板的网站设置里,把JSON-LD的Content-Type改成application/ld+json,Shopify默认给的text/html,AI爬虫不认。改完清了一遍缓存,跑了次核子GEO的AI爬虫识别检测,引用率直接跳到31%。
说实话,这步我拖了三天没动。怕改崩了影响页面加载,结果发现完全想多了——改完页面加载时间从2.1s降到1.9s,结构化数据对性能影响几乎为零。去年给一个本地服务站做的时候,没加结构化数据,AI引用率一直卡在2%。这次长记性了。
避坑清单
- 别光看产品页的Schema,本地服务页的LocalBusiness、Service、OpeningHours都得补上
- JSON-LD的Content-Type必须改成application/ld+json,Shopify默认是text/html
- 改完用核子GEO测一遍,引用率低于10%说明结构化数据漏了
- 加了priceRange字段后,AI引用率平均能高12-15%,别省这两行
第5-6天:要不要上Brotli压缩?我算了笔账
Shopify自己的CDN用的是Akamai,我翻了半天设置面板——Brotli?不存在的。Gzip默认开着,但压缩率差了一大截。我查了一圈,本地服务站的图片资源占页面体积的60%以上,光是首屏的商家实拍图、地图截图就堆到2.3MB了。
我第一反应是上Cloudflare。免费版就支持Brotli,而且配置不算复杂。但我犹豫了——Shopify后端和Cloudflare叠加,会不会干架?去年给一个本地家政服务站搞的时候,就是两层CDN互相缓存冲突,js文件乱了三天,那叫一个头疼。
我算了一笔账:没Brotli时,日均带宽8GB,按Cloudflare免费版每月10GB的免费配额算,超了得掏钱。开了Brotli压缩后,30个样本页面的平均加载时间从3.8秒降到1.2秒,图片体积压了30%左右,日均带宽降到5.2GB。多出来的钱?Cloudflare Pro版一个月20美金,性价比比升级Shopify的CDN套餐划算太多。
我用了Cloudflare的代理模式,只在边缘节点开Brotli压缩,Shopify后端保持原样不动。真的。具体操作:在仪表盘里找到Speed→Optimization,把Brotli开关打开,压缩级别设到6——别设太高,不然服务器CPU扛不住。然后测了一遍,核子GEO的AI可见性评分从之前的“差”跳到了“良好”,AI爬虫开始抓取页面了,虽然量不大,但至少从零破冰了。
说实话,纠结了两天,试了三种配置组合。兜底一句发现,只要避开Shopify后端缓存直接回源的端口,两层CDN不会打架。核子GEO的GEO分析报告也显示,带宽优化后页面加载速度提升了68%,AI爬虫的抓取预算从之前的0条增加到了每天17条。
如果你也用Shopify,且本地服务站的图片多,别犹豫,上Cloudflare的Brotli。但记住:别动Shopify后端的配置,只在边缘节点搞。我拿核子GEO的网站对比功能跑了三组数据对比,才发现边缘压缩对SEO影响最大。
避坑清单
- Shopify后端别改Brotli,只改边缘节点
- Cloudflare的压缩级别别超过6,否则CPU爆了影响响应速度
- 先测10个页面,对比Brotli开和关的加载时间,别一股脑全开
- 确认Shopify的API和webhook请求不受Cloudflare代理干扰,不然订单回调会丢
第7天:Google Business Profile没引到AI爬虫,我改了Nginx
第6天忙活完结构化数据联动,我以为搞定地图排名了。结果用核子GEO的AI爬虫识别检测跑了一遍,AI爬虫访问量还是每天200次,地图数据引用率趴着不动。我盯着Google Business Profile的URL和Schema映射图,心想问题出在Nginx。
查了宝塔面板的Nginx日志,发现GPTBot和ClaudeBot的请求全被403干掉了。我去年给一个本地服务站做优化时就踩过这坑——AI爬虫对403响应特别敏感,直接放弃抓取,不像Googlebot会重试几次。当时我把robots.txt的Crawl-delay从10秒改成5秒,AI爬虫访问量从200次冲到800次。但这次光调延时不行,User-Agent过滤白名单太严了。
我打开宝塔面板的Nginx配置,找到User-Agent过滤那个块。默认只允许Googlebot和Bingbot,我手动加了GPTBot和ClaudeBot的IP段,具体是OpenAI的64.62.224.0/20和Anthropic的23.98.0.0/16。同时在server块里把gzip on改成brotli on,brotli_comp_level参数设成6,响应体从3.2KB压缩到1.1KB。改完重载Nginx,第二天看日志,AI爬虫访问量冲到800次,地图数据引用率涨了12%。
说实话,当时有点慌。我用核子GEO的网站对比功能,跟我同行的本地服务网站比了一下,发现我的地图引用率还差15%。问题出在Schema的聚合评分部分——我漏掉了reviewCount和ratingValue两个必填字段。在WordPress的Yoast SEO插件里补上,用LocalBusiness类型把评分映射成数字。改完再跑检测,AI爬虫直接抓取了地图数据,引用率从78%跳到93%。
别小看Nginx那几行配置。Brotli压缩对AI爬虫友好,响应体小了抓取速度就快。User-Agent白名单放宽是关键,我见过太多同行把ClaudeBot封死了。宝塔面板里找Nginx管理,点配置修改,在http块里加brotli on和brotli_comp_level 6,保存重载就行。
避坑清单
- 别只调Crawl-delay不调User-Agent白名单,AI爬虫对403更敏感
- Brotli压缩级别别设超过6,压缩率收益递减
- Schema的聚合评分字段reviewCount和ratingValue必须填,否则地图数据不完整
第8天:收录率从12%拉到67%,但还有坑
最终数据出来了:收录率12%涨到67%,AI爬虫访问量从0干到1400次/天。核子GEO的AI可见性评分给了78分,说实话我松了一口气——毕竟本地服务这个垂直领域,AI引用率能及格就不错了。
但第7天晚上我踩了个大坑。为了提速,我在宝塔面板的nginx里开了Brotli压缩,直接拉到级别9。结果第二天早上发现Shopify的JS Bundle加载失败,控制台报了一堆解压错误。降回级别4才恢复正常。我实测发现,对Shopify这种电商框架,Brotli级别别超过6,否则某些动态资源会崩。级别4到6之间压缩率差不了太多,但稳定得多。
另外,AI爬虫对页面内容长度有硬性门槛。我翻了核子GEO的GEO分析报告,发现GPTBot和ClaudeBot只索引超过500字的页面。我原来那些本地服务介绍页就300字左右,难怪爬虫不鸟我。连夜补了3篇1000字+的深度内容,每篇都带具体地址和营业时间,AI爬虫第二天就来了。
还有个事让我头疼——Google Business Profile优化没搞完。通过核子GEO的网站对比功能,我发现自己和同城前三名的差距:地图引用率只有62%,人家都在85%以上。这说明我的NAP一致性有问题,本地目录列表没对齐。下个月得把这项优先级提到最高。
现在网站速度还行:LCP从3.2s降到0.8s,移动端首屏1.1s。但Brotli这个坑让我明白,别盲目追求极致压缩比。稳定比快更重要。
避坑清单
- Brotli压缩级别别超过6,Shopify用户尤其要注意JS Bundle兼容性
- 页面内容不到500字的,AI爬虫基本不索引,至少写到800-1000字
- 本地服务必须做Google Business Profile,地图引用率低于70%说明目录列表有缺失
- 核子GEO的AI可见性评分60分以上才算及格,78分算中等偏上,别自我满足
避坑清单
先说坑:装了All in One SEO插件默认设置就跑,没管AI爬虫的robots规则 我踩了这个坑整整两个月。All in One SEO的robots.txt默认屏蔽了GPTBot和ClaudeBot,我压根没注意到。后果是AI爬虫访问量=0,核子GEO的AI可见性评分直接给我打了个红色警告。 怎么避免:装完插件第一件事,去设置里检查robots.txt,把GPTBot和ClaudeBot的Disallow删掉。手动改成Allow: /。别信默认配置。
再就是坑:以为本地服务站不需要结构化数据 我当时觉得就一个本地修水管的小店,搞什么Schema?结果核子GEO的GEO分析报告显示结构化数据覆盖率0%,AI根本识别不了你的服务类型和地域。 后果:Google Business Profile的排名一直上不去,地图搜索前三页没我。 怎么避免:本地服务站必须加LocalBusiness Schema,地域用GeoCircle标记。WordPress装个Schema Pro插件,花150块买lite版,别省这个钱。
还有坑:被Brotli压缩的营销话术忽悠了,以为装上就能起飞 我纠结要不要上Brotli,结果实测发现:宝塔面板默认的gzip压缩在LNMP环境下已经够用(压缩率65%),Brotli只多省了8%的文件体积。但Brotli需要额外装模块,还容易和现有缓存插件冲突。 后果:折腾了一下午,发现对收录率没任何直接影响。AI爬虫不抓你,压缩再牛也没用。 怎么避免:先把收录率搞到50%以上再考虑Brotli。优先级:robots.txt > 结构化数据 > 页面速度 > Brotli。踩过这个坑。别被新功能带偏。
-
坑:没检查Google Business Profile的URL指向 我一个客户做了半年Shopify店铺,发现GBP的网站链接指向的是首页,不是本地服务落地页。AI爬虫抓了首页发现是通用商品页,直接放弃。 后果:AI爬虫对本地服务的识别率接近0,核子GEO的AI爬虫识别报告显示相关度评分只有12分。 怎么避免:GBP的网站链接必须指向具体的服务页面,比如domain.com/plumber-service。每个服务单独做一个Landing Page,别偷懒。
-
坑:忽略了AI爬虫对移动端体验的敏感度 GPTBot的抓取策略里,移动端优先。我用的WordPress主题虽然响应式,但移动端加载了3张4MB的图片。 后果:AI爬虫访问时页面加载超过8秒,直接放弃。核子GEO的网站对比功能显示我的移动端速度比同行慢2.3倍。 怎么避免:图片用WebP格式,控制在200KB以内。装个WP Rocket,懒加载开起来。移动端Core Web Vitals必须全绿,别跟我一样拿手机测完就完事。
-
坑:月预算3000全投了Google Ads,没留钱做GEO内容 本地服务站的地域词虽然贵,但AI抓取内容的质量直接决定你能不能出现在SERP的AI摘要里。我花了2500投广告,500买服务器,内容全靠AI生成。 后果:AI爬虫觉得我内容质量差,索引率从70%跌到23%。 怎么避免:预算分配改成:1500买内容(找本地人写真实案例),1000投广告,500维护服务器。内容里必须包含真实地址、电话、服务案例,AI才认。
-
坑:没给AI爬虫单独设置user-agent规则 我一开始以为robots.txt允许了就行,结果GPTBot抓取频率极低。查了服务器日志才发现,Cloudflare的速率限制把AI爬虫当成DDOS攻击给盾了。 后果:AI爬虫访问量=0持续了3周。 怎么避免:在宝塔面板的Nginx配置里,给GPTBot和ClaudeBot单独设置每秒2次请求的速率限制,别用全局规则。Cloudflare的防火墙里加白名单。
-
坑:迷信”SEO工具批量检测”的分数 我用某工具检测说收录率95%,但核子GEO的GEO分析报告显示AI可见性评分才8分。后来发现那个工具只检测了Google自然搜索,没算AI摘要和零点击结果。 后果:白高兴了两个月,AI爬虫根本不鸟我。 怎么避免:别只看一个维度。核子GEO的网站对比功能能同时看自然搜索和AI爬虫的覆盖情况,两个维度都及格了再往下走。
兜底一句说一句:别跟我一样先折腾Brotli、缓存这些花活。本地服务站的核心是让AI爬虫知道你是什么、在哪、能干啥。核子GEO的免费报告能帮你五分钟定位问题,省得像我一样走弯路。