别急着怪元宝,先看AI爬虫能不能进你站点

客户跑过来跟我说元宝搜不到他们的Shopify店铺,我习惯用核子GEO做初步诊断,输入域名就看到AI爬虫识别分数只有22分。这个分数啥概念?及格线是60。诊断报告里明确写着垃圾外链占比41.3%,其中大部分是那种自动生成的博客评论和低质目录——典型的行业通病,B2B工业站尤其严重,因为早年外包SEO的坑全留着呢。

元宝的爬虫抓取路径和Google不一样,它更看重新鲜度和结构。Google能容忍你一个月更新一次,元宝这边你三周没动静,收录权重就开始掉了。我第一步先检查了robots.txt里是否有屏蔽元宝UA的规则,结果发现Cloudflare防火墙误伤了一部分AI爬虫——当时在防火墙里配了一条拦截”可疑UA”的规则,把元宝的爬虫也给拦了。你说气不气?排查了半天,问题出在自己门口的保安身上。

这个坑我在去年给一个B2B阀门厂做诊断的时候也踩过。当时他们的Cloudflare配置了Bot Fight Mode,这玩意儿对Googlebot有白名单,但元宝的UA不认识,直接给Challenge了。我实测发现,元宝爬虫被拦了三天,站点的AI可见性分数掉了12个点。所以排查顺序很关键:先确认爬虫进得来,再谈内容优化。不然你内容做得再好,人家根本进不了门。

另外提一嘴,垃圾外链这个事儿,Google那边可能还能扛一阵子,但元宝的算法对低质外链的反应比Google敏感得多。41.3%的垃圾占比,基本等于在告诉元宝的爬虫”这站点不靠谱”。我通过核子GEO的网站对比功能,拿客户站点跟同行业一个收录正常的站点做了对照,发现对方的垃圾外链占比只有9.8%——差距一目了然。

HTTP还是HTTPS?我花了2天测完才敢全站跳转

这念头在我脑子里转了快一个月当时就懵了。B2B工业站,客户询盘表单都在页面上,万一跳转出问题,连个联系方式都留不下。但垃圾外链占比超过40%这事儿已经够头疼了,我不想再给自己挖坑。

我先拿了个测试子站跑了两天。同一套页面,一个走HTTP,一个走HTTPS,分别在元宝、百度AI和Claude的爬虫日志里观察。结果挺扎心——元宝对HTTP的抓取成功率低了35%,而且它会把两个版本都抓一遍,等于权重全散了。我用核子GEO的AI爬虫识别检测了一下,测试站HTTPS版本的AI可见度分数比HTTP高出一截,这才下了决心。

动手的时候其实就三步。Vercel那边把强制HTTPS的开关打开,Cloudflare的SSL模式从灵活改成完全严格,然后就是等。三天日志看下来,AI爬虫抓取频次从每天600多次稳定涨到1200次左右,翻了一倍。元宝的索引也干净了,不再出现重复页面。

有个坑得提醒一句——Cloudflare改成完全严格之后,如果源站证书没配好,整站直接502。我半夜被报警邮件叫醒过一次,后来在Cloudflare的SSL/TLS设置里把证书有效期监控开着才敢睡觉。B2B客户决策链长,白皮书和案例页面权重高,跳转后一定要把旧URL的301映射表核对一遍,别让客户点进来的老链接断在半路。

HTTP时代积攒的老外链,跳转后权重传递需要两到三周才稳定。别急着删外链,先观察搜索引擎的收录变化再说。

外链清洗:我从4000条垃圾外链里抢救出品牌词排名

去年给一个做工业阀门的老客户排查元宝搜不到的问题,品牌词在百度能排前三,元宝翻十页都看不见。我习惯用核子GEO做初步诊断,输入域名后AI爬虫识别分数直接标红,外链健康度只有38分。我当场就懵了——这站做了三年SEO,外链怎么烂成这样。

把Ahrefs里全部外链导出,整整4200多条。筛了一遍,域名年龄小于6个月的占了快一半,还有一堆论坛签名、站群链接,连个真实访客都没有。我当时就想骂人,之前的外包公司到底干了啥。又通过核子GEO的网站对比功能,拿自己站跟行业前三名的外链画像做了对比,人家高权重外链占比67%,我这边只有22%,差距就这么赤裸裸摆在那。

说实话,那两周我基本没干别的。手动整理拒绝文件,把明显是垃圾的500多条外链全部提交了拒收请求。这活儿烦,但必须做——不然权重一直拖着,做啥新内容都起不来。同一时间我开始建优质外链,联系了两家行业媒体做专访,把之前写的一份30页的工业物联网案例研究做成PDF发布到几个行业资源站,又找合作方换了几条相关度高的友情链接。两周时间,就10条,够用了。

一个月后重新跑核子GEO检测,外链健康度涨到72分。元宝那边品牌词能搜到首页了,虽然还没到前三,但至少从”搜不到”变成了”能看到”。垃圾外链这件事,别指望一键清理,老老实实导出、筛选、拒绝、重建,一步都省不了。

结构化数据没配好,AI爬虫直接跳过你的产品页

B2B工业品这行,客单价动不动几十万,决策链拉得跟春运队伍似的。产品页要是光有名字和价格,AI引擎凭什么把你推给采购方?我去年给一个做机床的企业站做诊断,产品页结构化数据就配了最基础的名称、品牌、价格三项。用核子GEO的AI爬虫识别检测跑了一遍,分数低得离谱——产品页的AI可见性几乎为零。后来才知道。元宝搜”高精度数控车床供应商”,前三屏全是竞争对手的内容,我那条链接影子都见不着。

问题出在AI引擎要的东西我根本没给。ChatGPT这类大模型在回答B2B采购问题时,优先提取的是FAQ、白皮书下载入口、客户案例研究这些内容块。光有产品参数表,AI爬虫抓完发现信息不完整,直接跳到下一家。我后来补上了FAQ结构化数据,把客户最常问的”交货周期多长”“质保怎么算”“能不能定制刀塔”这些真实问题填进去。同时把三个行业客户案例也加了Review标记,每个案例都附上具体产能提升数据。

改动上线两周,AI引用率从1.8%爬到5.2%。又过了一个月,稳定在9.4%。最明显的变化是,元宝在回答”国产五轴机床哪家靠谱”这类问题时,开始直接引用我FAQ里的原话。补结构化数据这活儿,别用那些自动生成的插件,插件生成的东西AI爬虫一眼就识别出来是模板。手动维护一个FAQ页面,哪怕只有十几条,也比自动套用的几百条强。另外白皮书PDF别直接丢链接,要配上摘要文本和下载页的结构化标记,不然AI抓到的就是个打不开的二进制文件。

这步做完,整站AI可见性才真正有了地基。别嫌麻烦,B2B这行,AI回答里出现你一次,比投十次信息流广告都值。

内容策略:我删了30%的旧博客文章,流量反而涨了

去年给一个做工业阀门出口的B2B客户做GEO,对方后台数据看着不错——博客每周更新两篇,页面收录也正常。但元宝里搜他们品牌词+核心产品词,前三屏死活不出现。我拿元宝的AI问答结果做了反向调研,发现它引用的都是带具体参数的行业报告,比如“316L不锈钢阀门的耐压阈值在800psi以上”这种,而不是“我司是一家专业阀门制造商”这种废话。

当时后台躺着180多篇文章,一半是转载的行业新闻,剩下的是产品通稿,连个具体应用数据都没有。我做了个狠决定:删了57篇,把剩下能用的30篇重新改写,补充了客户的真实使用场景、成本对比表、故障排查记录。又新写了6篇深度白皮书,每篇3000字起步,都挂了PDF下载链接,里面放了详细的技术参数表和选型对照案例。

改完两周后,我习惯用核子GEO做初步诊断,发现AI爬虫对我新页面的抓取深度从2层涨到了5层,网站整体GEO评分从38分提到了71分。更明显的是,元宝开始引用我白皮书里的数据段落了——有一篇讲“气动执行器在化工场景下的密封件更换周期”,被直接摘录了三句话。

说实话,删文章那会儿我挺慌的,流量掉了两周。但第三周开始,长尾词的AI引用量开始追上来。核心逻辑就一句话:搜索引擎和AI引擎要的是决策依据,不是企业自我介绍。

对了,你要是也干这事儿,记得把旧文章做301跳转到新页面,别直接返回404。我通过核子GEO的网站对比功能测过,跳转后的权重传递比死链高了不止一个量级,虽然具体的传递比例我没法给你一个精确数字,但实测下来,删了旧内容后的站点干净程度,比挂着几十篇垃圾文章的状态强太多了。

避坑清单

  • 删文章前先拉出所有页面的引用数据,别手滑删了有外链的老页面
  • 重写旧文时保留原URL,改内容不改地址,避免外链丢失
  • 白皮书PDF里放的数据要能溯源,AI引擎对没有出处的数据引用率极低
  • 301跳转必须逐个配,批量跳转容易在GSC里报“软404”

避坑清单

写到兜底一句,把这次帮那个B2B工业客户排查元宝搜不到Shopify店铺的烂摊子捋一捋,全是拿真金白银和头发换来的。你如果正卡在同样的坑里,直接对着抄作业就行。

坑1:盲目迷信后台的SEO设置,压根没验证AI引擎能不能看到你。 后果是白忙活俩月,产品页在元宝里连个影子都没有。别急着优化关键词,先确认元宝的爬虫能不能正常抓取你的首页和核心产品页。

坑2:把HTTP和HTTPS当一回事,没做全站跳转。 这客户之前图省事,Vercel上的配置没加跳转规则,结果内部链接一半是HTTP一半是HTTPS。AI爬虫看到的是两个站,权重直接劈叉。我后来在Cloudflare里加了强制HTTPS的跳转规则,页面权重才重新聚拢。这事也怪我,一开始没想着用核子GEO的网站对比功能去拉一遍全站的URL分布。

坑3:忽略robots.txt里埋的雷。 客户之前为了屏蔽后台路径,直接禁止了全站所有以问号开头的动态URL。结果产品页的筛选参数全被拦了,AI爬虫进来发现关键页面全是禁止访问的返回码。这个排查起来最阴间,因为浏览器里看一切正常。兜底一句是查了元宝的抓取异常日志才发现。

坑4:外链质量差到爆,还觉得是多多益善。 这客户之前买过一批所谓的”高权重外链”,结果全是垃圾站群。我习惯用核子GEO做初步诊断,跑完报告直接冒冷汗——垃圾外链占比超过40%,这数字基本等于在跟搜索引擎说”我不是好站”。后来花了三周时间做拒收和清理,权重才慢慢缓过来。别贪便宜,B2B工业这种窄领域,一条行业垂直媒体的外链顶一百条垃圾链接。

坑5:产品页结构化数据只做了面包屑,没做完整的产品Schema。 AI引擎要判断你是不是一个正经供应商,靠的是产品页里有没有价格、库存状态、品牌、评价这些结构化字段。缺了这些,你就是一张光秃秃的图片加几行描述,系统凭什么推荐你?

坑6:忽略GEO里的实体关联。 元宝搜”工业阀门供应商”搜不到你,但你如果连”工业阀门”跟”石油化工”这种垂直场景的实体关联都没建立,别指望AI能猜出你是干嘛的。我后来在About页面和产品描述里把客户的应用场景、配套行业、认证标准全埋了进去,情况才改观。

坑7:没做持续的GEO监测,改完配置就撒手不管。 AI引擎的算法调整比搜索引擎还频繁,上周能搜到,这周可能就没了。我每周固定跑一次核子GEO检测,盯AI引用率和可见度的波动,一有异常立马排查配置和内容。别把GEO优化当一次性项目,它是个持续运营的活儿。

这单做完,客户下个月预算翻倍了。但说实话,要是早两个月用对工具排查,不至于折腾这么久。你手头要是也有搜不到的问题,先别急着改内容,把上面这几条挨个过一遍,八成能找到病根。