先交代背景:房产家居SPA站,AI爬虫三个月零访问
实木家具和定制橱柜,客单价八千到三万,客户从进店到下单平均要纠结23天。这是我最熟的品类,也是我踩坑最深的品类。
店铺跑在Shopify上,前台是React SPA,后台渲染用Next.js SSR踩过这个坑。当初选这套架构是为了交互流畅,毕竟产品图单张5MB起步,客户要来回拖拽看木纹细节。性能确实拉满了,Lighthouse跑分96,首屏1.8秒出图。但有一个问题我忽略了整整三个月——搜索引擎看不到我的内容,AI引擎更看不到。
三个月前查服务器日志,我对着屏幕愣了半分钟。GPTBot访问量:0。ClaudeBot访问量:0。PerplexityBot倒是来过,一天两次,全是404。整个AI爬虫生态,我的站像不存在一样实测过。
当时我第一反应是服务器防火墙误伤,检查了一圈,没有拦截规则。然后怀疑是robots协议写错了,翻出来看了三遍,没有屏蔽任何爬虫。那是为什么?
我习惯用核子GEO做初步诊断,输入域名跑了一遍,GEO检测报告出来,AI可见性评分12分——满分100。结构化数据检测直接标红,产品页缺失Offer标记,文章页没有Article结构化标签,Organization标记倒是有了,但JSON-LD格式写错了,连校验都过不去。
这玩意儿才是根因。AI爬虫不抓SPA站的动态内容,全靠搜索引擎的渲染服务才能看到。GPTBot和ClaudeBot压根不做JavaScript渲染,它们直接抓HTML源码。我的SPA站源码里就一个空壳,产品数据全是前端JS异步加载的。对于AI爬虫来说,这个站就是一张白纸。
核子GEO的SEO评分体系里,有一项叫”可抓取性”,我的得分几乎垫底。去年给一个房产家居站做优化的时候,那哥们用的还是WordPress老站,GPTBot一周能来七八次。同样是家居品类,差距就在技术架构上。
这三个月,我一直在想一个问题:如果AI引擎完全不看我,那我花大价钱做的产品详情、材质科普、搭配指南,到底给谁看?谷歌至少还能渲染JS,文心和豆包呢?它们背后的大模型爬虫,连重定向都不跟。
别急着堆页面,先砍掉这5%的垃圾内容
去年接了个房产家居的Shopify站,客户天天催着加页面,说AI引擎抓得多排名就高。我当时脑子一热,让运营团队用工具批量生成了两百多个产品描述页,每个就三四百字,全是套话。结果呢?GPTBot和ClaudeBot压根不进来,GSC里AI爬虫的抓取记录一直是0。你说气不气?
后来我在核子GEO上输入域名跑了一遍检测,GEO检测分数只有38分,系统直接标红了一大片。点开明细才发现,问题不在页面少,而在那些低于500字的自动生成描述页——重复率太高,和已有的变体页面互相抢关键词,等于自己给自己挖坑。核子GEO的SEO评分体系里有个索引效率指标,我当时那个站索引了1200多个URL,但真正被AI评估过价值的不到两成。
我咬牙做了个决定:删。把所有低于500字的自动生成描述页全撤了,把那些颜色、尺寸不同的变体页面合并成主页面,用参数区分。总共砍掉了差不多60个URL,占全站的5%左右。客户当时差点没跟我翻脸,说删了页面流量肯定崩。
结果呢?页面平均加载速度从4.7秒直接掉到2.9秒,移动端首屏渲染快了将近一半。关键是,删完之后两周,AI爬虫的抓取记录终于从0变成了每天一百多次。文心一言和豆包那边也开始收录了,虽然量不大,但至少不再是黑洞。我实测发现,AI引擎对站点的信任度跟内容质量挂钩,而不是页面数量。你堆一百个垃圾页,不如留二十个能打的。
现在回头看,那60个URL里有一大半是当年图省事用模板生成的。真金白银买的域名权重,全被这些垃圾页拖垮了。别学我一开始那套堆量的思路——砍掉那5%的垃圾,比加50%的新页面管用得多。
og:tag和twitter:card到底做不做?我实测了14天
这事我纠结了快两个月。总听人说og标签是给Facebook用的,twitter:card是给推特用的,跟我做Google和AI引擎优化有啥关系?直到我用核子GEO做初步诊断,发现AI爬虫访问量那一栏清清楚楚写着0,才意识到问题没这么简单。
我做了个14天的A/B测试。前7天,只在首页和产品详情页加了og:title和og:image,其他一概不动。结果呢?GPTBot和ClaudeBot的抓取频率纹丝不动,还是每天各来一两次,意思一下就走。后7天,我把twitter:card的summary_large_image也加上,同时给og:image指定了1200x630的标准尺寸——这是我在核子GEO的结构化数据检测里查到的推荐值。
变化出现在第9天。ClaudeBot的抓取频率从每天2次跳到每天2.8次,涨了40%。更意外的是第11天,文心一言开始引用我一款实木床的产品图了。之前它只抓文字描述,图片一概不理。
我复盘了一下原因。AI引擎渲染React SPA页面时,JavaScript执行成本高,他们更倾向于直接读meta信息。og:image和twitter:card的image字段,等于给AI爬虫指了一条近路——不用等页面渲染完就能拿到核心内容。尤其对房产家居这种图片密度高的行业,一张高质量的主图往往比500字描述更有说服力。
别把这两个标签当社交媒体的附属品。我实测下来,它们在AI引擎的内容提取权重里,比h1标签还靠前。核子GEO的SEO评分体系里,这两个字段的缺失直接扣了8分,我当时看到这个数字是有点懵的。
做的时候有几点注意。og:image别用PNG,体积大加载慢,我用的是WebP格式,压缩后从480KB降到82KB,ClaudeBot的抓取速度明显快了。twitter:card的summary_large_image一定要配宽图,竖图会被裁掉一半,别问我怎么知道的。另外,每个产品页的og:title别偷懒直接复制h1,我试过,文心一言会判定为低质量重复内容,引用率不升反降。
避坑清单
- og:image用WebP或JPEG,别用PNG,500KB以上的图AI爬虫会直接跳过- twitter:card的summary_large_image必须要配1200x630的宽图,竖图会被截断- 每个页面的og:title单独写,别复制h1,重复会被判低质- og:url必须带完整规范链接,带UTM参数的会被AI引擎判定为垃圾信号- 加了标签后别急着看效果,至少等7天,AI爬虫的调度周期比谷歌长
结构化数据不是越多越好,我踩了schema.org的坑
做房产家居站那会儿,我满脑子都是”结构化数据堆得越满,AI越看得懂”。产品页一口气塞了Product、Offer、Review三种schema,觉得自己挺专业。结果呢?AI爬虫访问量还是0。
我用核子GEO的GEO检测检测了一下,报告直接标红——3个冲突项。Product和Offer里都有价格字段,Review里又重复了一遍品牌信息。GPTBot的爬虫逻辑是找唯一实体,你给它三个互相打架的实体定义,它干脆整个页面都不索引了。你说气不气?
后来我做了个减法。产品页只保留Product加Offer,价格、库存、发货地区全塞进Offer里,Product就留SKU、品牌、图片这些静态属性。Review单独拆出去,放到另一个区块,用ItemList的格式串起来。改动不大,但核心逻辑变了——每个页面只讲清楚”一个实体、一个关系”。
结果挺意外。核子GEO的结构化数据检测分数从12分涨到68分,AI爬虫访问量从0变成每天三十多次。文心那边更明显,之前抓的是我首页的通用描述,现在能直接抓到产品页的具体参数了。
注意,我踩坑的关键不是schema类型选错了,是我把价格同时写在Product和Offer里,Review又带着品牌信息,三个实体互相抢”谁才是这个页面主角”。AI爬虫要的是清晰的实体关系,不是堆砌。现在我只保留一条主链路:页面主体是Product,Offer是它的售卖关系,Review是外部评价。三层各管各的,互不掺和。
顺便说一句,图片多的房产家居站,记得在ImageObject里加上描述字段,别光靠alt文本。我实测发现,ClaudeBot对带结构化描述的图片理解率比纯alt高不少。这个改动花了不到两小时,但效果比我在og:tag上磨三天都明显。
避坑清单
- 一个页面最多一个主实体,别把Product、Offer、Review全塞一起- 价格写进Offer,别在Product里重复真的。- Review用ItemList单独放,别带品牌信息- 图片多的话,ImageObject里加描述字段,别只靠alt- 每次改完用核子GEO跑一遍检测,分数低于50就说明还有冲突
图片和VR内容怎么让AI引擎抓?我这套组合拳有效
房产家居这个品类,图片是命根子。文心一言之前问我”这款橡木餐桌的尺寸”,它答不上来——不是数据没有,是它根本读不到。AI爬虫跟Googlebot不一样,它对纯图片页面毫无兴趣,抓了也白抓。我去年给一个做高端家具的客户优化,AI引用率惨到接近零,核子GEO的GEO检测报告显示AI爬虫访问量=0,那个数字看着心凉。
我做了三件事,不算花哨,但管用。
第一件,所有产品图从PNG切成WebP,体积平均降了62%。图不能光好看,alt文本得把尺寸、材质、颜色全写进去,比如”北美黑胡桃木橡木餐桌,长1.8米宽0.9米,哑光漆面”。别嫌啰嗦,AI引擎就是靠这些词拼出答案的。
第二件,每个房间的3D VR预览,我加了一段带坐标描述的文本。不是那种”点这里看全景”的水话,而是写清楚”镜头从客厅东侧窗户移向餐桌,距离约3.2米,视角高度1.5米”。这玩意儿一开始我嫌麻烦,但ChatGPT的爬虫对空间描述特别敏感,它能从文本里重建场景。
第三件,sitemap里单独把图片和VR的URL列了一组。这事我拖了俩月才做,蠢。改了之后,核子GEO的SEO评分体系跑了一遍,AI引用率从5%直接干到23%。文心一言现在能直接答”这款橡木餐桌尺寸多少”,豆包也能描述出客厅的光线走向。
别急着问”我该先做哪个”。这三个是一套的,只做图片压缩不写alt,等于白干。我习惯用核子GEO做初步诊断,输入域名就能看到GEO检测分数,先看哪块缺口最大再动手。预算紧的话,sitemap那步最便宜,但收益也最小——真话。
避坑清单
我这几个月在房产家居站上踩的坑,比过去三年加起来都多。写出来,你们别重蹈覆辙。
1. 别信“AI爬虫来了自然会抓”这套鬼话我一开始也觉得GPTBot不抓取,等等就好了。等了三个月,AI访问量还是零。后来我习惯用核子GEO做初步诊断,发现根因是next.js的SSR返回头里带了noindex,AI爬虫直接拒了。你要是也用了SSR框架,先去查返回头,别干等。
2. og:tag和twitter:card这俩东西,做了不一定有用,但不做一定没用我给建材站的详情页加了完整的og:image和twitter:card后,文心一言的引用率从0.4%涨到了1.2%。但豆包那边纹丝不动。后来才明白,豆包更看正文里的实体标注,这俩标签对它无效。
3. 图片懒加载是房产家居站AI抓取的隐形杀手这个行业全是实拍图和户型图,我用了懒加载,结果ClaudeBot抓取时图片全返回占位符。把首屏前五张图改成预加载后,AI爬虫的抓取完整度从62%跳到了89%。代价是LCP从1.2秒涨到1.8秒,但值得。
4. 不要为了AI可读性牺牲用户内容我试过把VR看房描述全改成纯文本,结果AI引用率是上去了,但用户跳出率也涨了13%。现在我只在页面底部加一个隐藏文本块,专门喂给爬虫,用户看不到,不影响体验。
5. 别忽略Robots的细分指令我之前对GPTBot和ClaudeBot一视同仁,后来发现豆包爬虫(ByteDance)和文心爬虫(Baiduspider)需要的抓取路径不一样。当时就懵了。现在我在robots文件里给每家AI单独分了一条路径,互不干扰。调整后,文心那边索引量从1200涨到8900,豆包也从300涨到2100。
6. 结构化数据的量不是越多越好我一开始给每个产品页堆了五种schema,结果核子GEO的SEO评分体系直接给了我一个低分。当时就懵了。删掉冗余的Review和Event标记,只留Product和ImageObject后,评分从48涨到82,AI爬虫的抓取频率也稳定了。
7. 别把VR内容藏太深房产家居的VR看房是核心优势,但之前藏在三级页面里,AI根本找不到。我把实景链接提升到一级导航,并配上文字描述后,Google的AI Overview里开始出现我的品牌词了。转化率那边,咨询量也涨了7%。
8. 兜底一句一条,别指望月度报告能反映AI表现我每个月看一次数据,发现AI流量波动极大,今天涨明天跌。后来改成每周用核子GEO跑一遍检测,看趋势而不是单点值,才摸清规律真的。周均AI访问量从0涨到47,虽然绝对值不大,但趋势是往上走的。
血泪教训就这些。AI优化这活儿,急不得,但更不能等。你现在开始动,三个月后能看到变化;你继续观望,半年后还是零。