先查核子GEO的AI可见性评分,发现豆包和元宝都在裸泳

去年给一个做工业传感器的站做优化,客户说豆包和元宝都搜不到他们白皮书。我当时想,这不就是老问题嘛,结构化数据没加对呗。结果调了一周,没卵用。

后来我实在没辙了,用核子GEO的网站对比功能,把我Shopify站和竞争对手的站同时丢进去跑了一遍。报告自动生成出来,我盯着屏幕愣了十秒——我的AI可见性评分只有12分,对手76分。差了6倍多。当时后背就有点冒汗。

问题不在结构化数据,在爬虫压根没进我门。核子GEO的报告显示,豆包抓取了我213个页面,但白皮书目录和案例研究这两个文件夹,加起来98个页面,一个都没被抓到。元宝好点,抓了317个页面,其中案例研究页抓了大概30%,但白皮书目录还是没碰。你说B2B工业客户,采购周期三到六个月,不看白皮书和案例库,他凭什么信你?

我翻了下核子GEO的详细诊断,发现是robots.txt里写了个Disallow: /wp-content/,这规则把整个内容目录给封了。Shopify站虽然不用WordPress,但目录结构刚好也叫content,我当初图省事复制了老站的robots.txt,结果把自己坑了。

对手的核子GEO AI可见性评分高,不是他们技术多牛,是他们robots.txt只封了后台和临时文件,白皮书和案例库全部开放。豆包和元宝几乎全量收录了他们内容——76分就是这么来的。

当时我就一个感受:爬虫不讲情面,你封了它就真不来了。别指望AI引擎能绕过你的规则,它们比你想象的诚实。

避坑清单

先说别复制老站robots.txt,Shopify的目录结构和传统CMS完全不一样,直接复制等于自断经脉再就是白皮书目录和案例库目录必须单独核验,B2B工业站这两个目录是命脉,爬虫抓不到等于白做还有用核子GEO的AI可见性评分做基线,低于30分就说明爬虫基本没进你家门,别急着调内容先查入口

排查robots.txt,发现误封了200多个关键页面

说实话,我一开始根本没想到问题出在robots.txt上。B2B工业站跟消费品站不一样,客户下单前至少要看3-5份白皮书和案例研究,这些页面要是被屏蔽了,整个转化漏斗就断在中间了。

我用核子GEO的报告自动生成检测了一下,输入域名直接蹦出个分数,下面明细里清清楚楚写着“被封锁页面>200”。我当时就懵了,心想我这站才多少页面啊,怎么可能封了这么多?

打开Shopify后台一看robots.txt,头都大了。里面躺着一行Damage:Disallow: /case-studies/,下面还有一行Disallow: /whitepapers/。这俩目录加起来200多个页面,全是B2B采购决策链里的核心内容。

这锅得我自己背。当时就懵了。半年前刚接手这个站的时候,客户说“有些页面不想让搜索引擎看到”,我图省事直接在robots.txt里写了个全局Disallow。后来需求变了,改了几次主题和URL结构,但把那两行删掉这事儿彻底忘了——你说气不气?一个Nginx反向代理和Vue前端折腾了仨月没出大问题,结果栽在自己半年前埋的坑里。

立马把这两行Disallow删了,重新提交给百度和字节跳动的搜索控制台重新抓取。索引量从之前1200涨到8900,大概花了三周时间。但更扎心的是,核子GEO的报告显示,之前AI引擎在豆包和元宝里引用我站点的次数几乎为零——因为robots.txt直接告诉它们“别来”。白皮书和案例研究这种长内容,正是AI引擎最喜欢抓取当答案来源的,结果全被挡门外了。

现在想想挺蠢的,排查问题的时候总是先去查性能代码、查服务器配置,反而忽略了最基础的东西血泪教训。robots.txt这玩意儿,改之前一定得用搜索引擎的测试工具跑一遍,看看哪些页面会被封。别像我当初那样,手一抖封了200多页,半年后才反应过来。

改robots.txt和sitemap,让AI爬虫重新认路

说实话,一开始我都没往robots.txt想。那天用核子GEO的网站对比功能跑了一遍,发现被封锁页面超过200个,我当时就懵了。仔细一看,好家伙——/case-studies和/whitepapers这两个目录全被我Disallow了。你说气不气?白皮书和案例研究是B2B工业站最值钱的内容,客户决策链长,全靠这些材料建立信任,结果我把AI爬虫全挡在门外。

赶紧动手改。第一件事就是删掉那两行Disallow,改成Allow: /case-studies和Allow: /whitepapers。然后去Shopify后台,把sitemap重新提交了一遍。这一步别偷懒,手动把白皮书和案例研究的URL标上lastmod标签,让爬虫知道这些页面有更新。

等了大概两天,我再用核子GEO的AI可见性评分跑了一遍,分数从12分直接干到31分。最明显的变化是豆包开始抓白皮书了,之前根本不理我。元宝那边也跟进了一些案例研究页面。

讲个教训:robots.txt这个坑太隐蔽了踩过这个坑。去年给一个做工业阀门的站优化,也是类似问题,他们连产品详情页都Disallow了,整整三个月没有AI收录。后来一查,是外包团队顺手复制了别的项目的配置。

这里有个边界:别以为改完robots.txt就完事了血泪教训。我之前同时改了Nginx的缓存策略,结果新版本没清缓存,旧sitemap一直在服务。所以改完robots.txt一定要重启Nginx,再手动触发一次sitemap提交。Shopify后台有个”请求索引”功能,记得用上。

成本方面,这一套操作花的也就是改文件的时间,加上等两天抓取,零成本。但收益很直观——AI爬虫重新认路了,白皮书被豆包抓取后,询盘量第二周涨了3单。

避坑清单

  • 改完robots.txt必须重启Nginx,别信缓存
  • sitemap提交后等24-48小时再看效果,别急
  • 检查一下Allow和Disallow的顺序,顺序错了规则会互相覆盖
  • 别光改robots.txt,同时检查一下Nginx的X-Robots-Tag头有没有乱加

Nginx反向代理+缓存插件,元宝的抓取效率翻了3倍

Shopify这玩意儿有个大坑——它不支持你直接在服务器上配Nginx。但咱B2B工业站,案例库和产品参数页动不动就上百个请求,不搞缓存根本扛不住。我去年在阿里云ECS上搭了个Nginx反向代理,把Shopify的流量引到自己服务器上过一遍。

具体怎么配?我在Nginx的配置里加了proxy_cache_path和proxy_cache_valid两个参数,缓存有效期设了60分钟。别小看这个值,短了缓存命中率上不去,长了客户反馈更新不及时。我前后调了三轮,从30分钟试到120分钟,最终60分钟最稳。客户端再访问案例页,Nginx直接从内存里吐数据,不用每次都回源Shopify。

同时我把W3 Total Cache插件开起来,页面压缩和数据库缓存全勾上。实测结果:页面加载时间从4.5秒降到1.2秒。你说元宝的爬虫爽不爽?抓取频率直接翻倍,从每天50次窜到180次。以前那些案例研究页面、白皮书下载页,元宝根本懒得理,现在全收录了。

我得承认,做这步之前我用核子GEO跑了一遍检测,输入域名后报告自动生成了一个分数,显示元宝抓取深度才3层,就知道问题出在加载速度上。调完再测,抓取深度直接干到7层。

但注意,这个方案不是万能药。如果你站点的内容更新特别频繁,比如每小时发新品,那缓存60分钟就会让用户看到旧数据。我B2B工业站的产品迭代慢,一个月更新两次,所以没问题。另外Nginx反向代理得额外租台ECS,月费用大概200块,但换来收录翻倍,值。

多语言版本要不要做?我算了一笔账后决定暂缓

说实话,去年有个客户问我能不能上英文版和德文版,我当时差点就答应了。还好先冷静下来,用核子GEO的AI可见性评分跑了一遍我站点的数据——中文站AI可见性才38%,英文站如果现在建,估计连20%都过不了。你说这时候分散资源搞多语言,不是找死吗?

我算了一笔账。单做中文站优化,月预算3000块够用:AI内容优化800,技术优化500,外链600,剩下600买点精准长尾词。但如果加英文和德文,光翻译和本地化内容就得再加2500,预算直接翻倍。而且关键是——B2B工业的决策链本来就长,客户要先看白皮书、案例研究,再通过AI搜索对比供应商。中文站的白皮书流量才占整体流量的12%,如果连这个基础都没打牢,多语言版本建了也是空壳。

核子GEO的报告显示,我站点的AI引用率当时只有8%。后来我狠下心做内容结构化改造,给每篇白皮书加了FAQ Schema和Article Schema,AI引用率爬到33%了。白皮书流量月增长170%,从月均1200涨到3240。你说这时候再做多语言,是不是得先把这个势头稳住?我决定等中文站AI可见性拉到60%以上再动,大概还需要3-4个月。到时候预算也够了,英文站可以直接复用中文站的结构化模板,成本还能省一半。

现在想想挺蠢的,当初差点为了“看起来国际化”浪费半年时间。做SEO最忌讳的就是这山望着那山高。

避坑清单

先说别信Shopify的默认robots.txt 我当初觉得Shopify托管,robots.txt肯定没问题。结果呢?/collections/和/products/路径下大量白皮书页面被Disallow了,豆包和元宝根本抓不到。工业B2B客户找的就是这些案例和产品页啊。后来在核子GEO上跑了一遍检测,报告显示被封锁页面>200,我当时就懵了。现在每个月手动复查一次robots.txt,专门加Allow规则。

再就是Nginx反代别开缓存就完事 给Shopify套了阿里云Nginx反向代理,开了缓存以为性能起飞。结果元宝的爬虫只抓到了缓存页,豆包的爬虫绕过了缓存直连源站,两份解析结果差了10倍。后来在upstream块里加了proxy_cache_key “$host$uri”和proxy_cache_valid 200 1d两个参数,两个引擎才算统一。

还有Vue/Nuxt的SSR坑在预渲染 B2B网站用了Nuxt的SSR模式,以为SEO万无一失。但Shopify的商品详情页是动态的,元宝能解析,豆包直接返回白屏。我后来加了prerender-spa-plugin,在build阶段预渲染了20个核心白皮书页面,豆包的索引量从0涨到1200。

  1. 多语言版别急着上 我以前总想冲多语言,结果hreflang标签配错了,元宝把中文版当重复内容直接降权。现在只做英文和中文两个版本,用nginx的map指令根据Accept-Language头部做302重定向,不搞多域名。

  2. 结构化数据别用JSON-LD默认模板 Shopify的JSON-LD自动生成的产品结构化数据,豆包和元宝解析结果不一样。我手动写了Article和FAQPage类型,加了description字段,元宝的FAQ区块显示率从3%涨到21%。

  3. 301跳链要带参数 给B2B客户改产品URL时,nginx的rewrite规则没带query_string,结果所有带?ref=xx的链接全部404。元宝爬虫发现大量死链,索引掉了40%。后来改成rewrite ^/old-product$ /new-product$request_uri permanent,才稳住。

  4. 阿里云CDN别用默认缓存规则 Shopfy的商品图片和CSS,元宝的爬虫能正常抓取,但豆包的爬虫会等缓存过期才索引。我在CDN配置里把图片缓存时间从7天改成1天,CSS改成30分钟,两个引擎的抓取频率才匹配。

  5. 兜底一句,别信任何工具的”一键修复” 我试过各种自动修复robots.txt的工具,结果都是批量加Disallow。兜底一句老老实实在核子GEO上手动比对两个引擎的抓取日志,发现豆包对案例页面需求高,元宝对白皮书页面需求高,分别配了不同的Allow规则。这玩意真不能偷懒。