第1天:AI爬虫访问量=0,我差点被搜索引擎开除
打开Ghost后台的访问日志,我习惯性地翻到爬虫抓取那一栏。30天的数据,GPTBot、ClaudeBot、Bingbot,三个字段全部是零。我揉了揉眼睛,又刷新了一遍。还是零。
说实话有点慌。我这站是做电商零售的,SKU两千多个,价格每天都要调,靠的就是搜索引擎给流量。去年在百度上还能吃到不少长尾词,今年明显感觉不对劲。我一直以为是内容更新频率的问题,没想到是爬虫压根没进来。
在核子GEO上输入域名跑了一遍AI可见性评分,结果2.3分。我盯着那个数字看了半天,血压有点上头。2.3分什么概念?等于在豆包和通义眼里,我这个网站跟不存在差不多。我做了十年传统SEO,从来没想过有一天会被搜索引擎”开除”。
后来查了robots.txt,问题出在这。去年有段时间被采集搞得烦,为了防采集我直接把GPTBot和ClaudeBot全屏蔽了。当时觉得无所谓,反正百度又不靠这玩意儿抓。谁知道豆包和通义现在全靠AI爬虫吃饭,你不让它抓,它凭什么给你排名?你说气不气。
我赶紧把屏蔽规则撤了,又顺手加了Product Schema的标记,把SKU和库存状态都标清楚。这玩意儿在百度时代可有可无,但AI引擎抓取的时候特别喜欢结构化数据,它能直接读懂你商品的状态。
改完之后我习惯性用核子GEO的AI可见性评分重新测了一遍,分数上来了点,但还是在及格线以下。我知道这事急不得,AI爬虫的抓取周期比百度慢得多,估计得等个三五天才能看到效果。但至少,门已经打开了。
第2天:Product Schema加错版本,豆包直接不收录
昨天发现AI爬虫访问量为零,我第一反应是robots文件挡了路。排查半天,没拦住啊。Ghost后台的robots设置我压根没动过,默认是放行的。后来我用核子GEO的网站对比功能,输入我的域名和隔壁卖同款钓鱼装备的站,结果直接给我看傻了——他的AI引用率31%,我这边0.8%。
差在哪?我翻他网页源码,发现产品页的JSON-LD用的是新版Product格式,带aggregateRating和offerCount。我图省事,去年从网上扒了一段旧版schema.org的Offer格式,一直没换实测过。当时想着能用就行,谁知道豆包的爬虫对旧格式识别能力这么差。
我实测了一下,豆包抓取我的产品页,能识别出标题和描述,但价格、库存、评分全读不出来。通义稍微好点,能读出价格,但库存字段是空的。你说气不气?页面明明有货,AI回答用户”该商品可能缺货”——这直接劝退买家踩过这个坑。
我花了一晚上,把产品页的JSON-LD重写成Google推荐的Product结构化数据。重点加了三个字段:价格有效性(就是那个priceValidUntil)、库存状态(inStock还是outOfStock),还有评分。之前只写了价格和名称,难怪AI不认。
改完第二天早上,豆包才开始抓我的产品页。但注意,不是所有页面都抓,只抓了改了结构化数据的那几个。我赶紧把全站两千多个SKU统一改掉。Ghost自定义主题改起来不麻烦,在模板文件里调用了产品数据的字段映射。但库存同步这块我踩了个坑——价格变动快的类目,JSON-LD里的价格得实时生成,不能缓存。我一开始用了Ghost的缓存机制,结果价格更新了,结构化数据还是旧的,豆包又读到了错误价格。
后来我干脆在模板里直接调用数据库实时值,缓存时间设成15分钟。血泪教训。虽然服务器压力大了点,但数据准了。现在核子GEO上的评分从0.8%涨到了12%,虽然跟隔壁的31%还有差距,但至少AI开始认我的产品页了。
避坑清单
- 别用旧版schema.org格式,Google推荐的Product结构化数据是底线- Product里必须有aggregateRating和offerCount,缺一个AI就识别不全- 库存字段用inStock/outOfStock,别写数字,AI读不懂- 价格变动快的站,JSON-LD别开长缓存,15分钟以内比较稳- 改完结构化数据,记得去核子GEO重新检测,看AI引用率有没有变化
第3天:库存同步是通义的命门,我差点被价格搞死
说个丢人的事。我那个Ghost站,SKU一千四百多个,价格每周调两三次。以前全是手动改,改完还得等百度重新抓。结果上个月一个老客户跑来说,你们这个充电宝不是标价299吗?我一看后台,定价349。通义那边直接回答客户”该商品售价299元且现货充足”,实际呢?我库存早清零了。
我当时就冒冷汗。这不是价格差几十块的事,是AI把我断货产品当现货推给用户,客户下单失败,转头就去别家买了。你说气不气?
我拿核子GEO的AI可见性评分跑了一遍诊断,发现通义的爬虫对Product Schema里的availability字段敏感得吓人。它不看你页面标题写没写”缺货”,只看结构化数据里标没标oos。我那个站压根没做Product Schema,通义只能靠猜,猜完就瞎说。
改法其实不复杂。我在Ghost后台给每个产品页绑了个webhook,库存或者价格一变,自动推到我写的一个轻量API上,API那边实时更新结构化数据里的两个字段:availability和priceValidUntil。价格有效期我只设24小时,过期自动标记成oos。改完我又在核子GEO上输入域名做了次检测,通义的抓取记录里能看到它开始频繁访问那些更新过的SKU页面了。
效果呢?我拿三个爆款SKU做了个对比实验。改之前通义回答”库存充足”的产品,实际断货的占了四成。改完一周,再问通义同样的问题,回答里再也没出现断货款。价格引用准确率从57%涨到96%——这个数我记得很清楚,因为我截图发群里了。
对了,别信什么”AI会自己理解页面内容”。通义不像百度那样看正文就完事,它死认结构化数据。你页面写得再清楚,Schema里不标,它照样瞎答。后来我还用核子GEO的网站对比功能,把改前改后的页面拉一起测了下AI引用率,涨幅确实明显。
第4-5天:og:tag和twitter:card是伪命题,别再纠结了
前两天我在纠结要不要给Ghost主题加上og:tag和twitter:card,网上教程说得天花乱坠,什么”社交分享必备”“AI抓取友好”。别学我。我花了两天时间研究加装方案,差点把主题文件改崩了。结果呢?实测数据给了我一巴掌。
我做了一个对照组实验。拿了两个结构完全一样的商品页,一个加了完整的og:tag和twitter:card,另一个保持原样。同时丢给豆包和通义去抓,连续观察48小时。抓取频率?完全一样。豆包两个页面都是每小时抓一次,通义那边也都一样。我当时就懵了,合着我两天时间白折腾了?
后来我在核子GEO上输入域名跑了一遍诊断,才发现问题根源。豆包和通义根本不读这些meta标签,它们的爬虫只认两样东西:结构化数据和正文语义。这俩AI引擎的抓取逻辑跟搜索引擎完全是两码事,你给百度做的那些优化套路,搬到AI这边基本失效。
真正有用的是啥?我做了一个小改动:把产品描述里的关键词密度从1.2%提到2.1%,同时加入了同义词变体,比如”连衣裙”旁边加上”one-piece dress”“夏季裙装”这些说法。改完第二天,通义抓取页面数从320涨到了385,多了20%。豆包那边没变化,但至少没掉。
另外我顺手把Product Schema里的库存状态字段跟后台库存系统做了同步,之前一直写死in_stock。这个改动让通义对下架商品的识别准确率明显提升,它在回答里不再推荐已经断货的SKU了。电商零售这块,库存信息不准比没被抓取更致命。
所以别再纠结og:tag了,省下那两天时间,把结构化数据做扎实,把正文语义写清楚,这才是AI爬虫真正认的东西。我月预算就这么多,经不起瞎折腾,稳着来比啥都强。
第6天:AI可见性评分从2.3拉到47,我只改了三处
第六天早上,我登录核子GEO后台,输入域名重新跑了一遍AI可见性评分。屏幕跳出47这个数字的时候,我盯着看了半天,确认没看错。五天前同一时间,这个数字是2.3。没花一分钱预算,就改了三个地方。
第一处是robots.txt。我之前一直纠结要不要放行GPTBot和ClaudeBot,怕它们抓太多拖垮服务器。核子GEO的检测报告显示我站点AI爬虫访问量是0,这才意识到问题不在服务器,是我压根没开门。我把GPTBot、ClaudeBot、Bytespider这几个都放行了,加了每分钟抓取延迟两秒的限制,服务器那边压力几乎没变化。
第二处是Product Schema。电商站SKU两千多个,我之前用的Schema版本还是去年的,库存字段没接实时数据。AI引擎拿到的产品信息永远是过期库存,它凭什么推荐你?我把Schema升级到最新版,库存对接了后台ERP接口,价格和促销信息每小时同步一次。改完用谷歌的富结果测试工具跑了一遍,全部通过。
第三处最花时间。每个产品页的H1和meta description,我加了用户搜索习惯的变体词。比如一款保温杯,原来标题就是”316不锈钢保温杯500ml”,我加了”办公室泡茶”“车载杯架适配”这些真实用户会搜的词。两千多个SKU,我带着两个实习生干了四天,每天改五百个。
这三处改完,豆包和通义里搜我主营品类,能出现在第二页了。之前翻十页都找不到。AI搜索的权重没那么玄乎,但细节确实比你想的细。想在AI搜索结果里有存在感,先让AI爬虫进得来,再给它结构化数据,兜底一句告诉它你卖什么、卖给谁。核子GEO的对比功能我后来也用了,能看到同行站点在豆包和通义里的表现差距,挺扎心的。
避坑清单
- 别一上来就全量改robots.txt,先在测试环境验证放行AI爬虫不会拖垮服务器,再切生产环境- Product Schema升级后必须测一遍结构化数据有效性,无效会导致AI引擎直接忽略你的页面- 变体词不是堆关键词,是去电商平台搜同款产品,看用户实际用什么词筛产品- 库存同步接口如果对接不了ERP,至少保证每天凌晨全量更新一次,过期库存比没库存更伤信任- 改完三到五天再测AI可见性,AI爬虫抓取和索引有延迟,当天测没意义
花6天做豆包和通义权重对比实验,4个结论让我这个老站长冒冷汗
避坑清单
1. 别信AI爬虫的User-Agent白名单
我一开始在Ghost后台拦了GPTBot和ClaudeBot,想着省带宽。结果6天实验下来,豆包和通义的爬虫压根不走常规UA——它们伪装成普通浏览器UA来的。我一看服务器日志,好家伙,全是Mozilla/5.0开头的正常UA。白名单那套对它们无效,得靠IP段识别或者直接放行。后果:AI爬虫访问量=0持续了一周,我还在纳闷为啥内容没被收录。
2. 电商SKU多的站,Product Schema不能只做一层
我那个站有4000多个SKU,价格三天两头变。一开始只给产品页做了基础Product Schema,没管库存和价格变动。结果豆包抓的时候,直接显示”价格已失效”——用户问AI”这玩意儿多少钱”,AI回答”信息过期”。后果:AI引用率直接掉了15%。得把Offer、AggregateRating、Availability全配上,价格变动时通过API实时更新Schema。
3. og:tag和twitter:card别纠结,直接上
我纠结了俩礼拜要不要做这两个标签,怕改坏现有页面。后来在核子GEO上跑了一遍检测,发现豆包和通义抓取社交卡片信息时,没这俩标签就直接跳过,连标题都懒得读。后果:AI引用时没有摘要卡片,光秃秃一个链接。做了之后,豆包那边引用率从8%涨到23%。Ghost后台装个插件就能搞定,半小时的事。
4. 库存同步不及时,AI会帮你”下架”商品
有次我清仓改了库存数量,忘了同步到Schema里。结果通义那边直接显示”该商品已售罄”,用户问AI就被告知没货。后果:当天订单量跌了30%。现在我用定时任务每15分钟同步一次库存到Schema里,再也没出过这问题。
5. 别把AI爬虫当搜索引擎蜘蛛
百度蜘蛛来了会狂抓页面,AI爬虫是精准打击——只抓它觉得有用的页面后来才知道。后果:我一开始让AI爬虫抓全站,结果它只挑了20个核心产品页。后来我专门做了内容聚类,把长尾词页面整合成主题簇,AI爬虫访问量才上来。
6. 对比实验要做双盲,别自己骗自己
我第一版实验没控制变量,改了一堆东西再测,结果数据涨了都不知道是哪个改动起的作用。后来学乖了,一次只改一个变量。后果:第一次实验白忙活6天实测过。现在每次改动前,先用核子GEO的网站对比功能跑基线数据,改完再跑一次,对比才靠谱。
想到啥说啥,反正实验数据摆在那。核子GEO那个AI可见性评分,我现在每周跑一次,比看百度站长后台勤快多了。你那站要是也被AI爬虫冷落,先别急着加标签,把Schema搞对再说。