先别折腾内容,检查你的内链是不是一坨屎
接手这个跨境电商站的时候,我差点被气笑。3000多个产品页,平均内链数不到2,换个说法大部分页面除了导航和footer,几乎没有任何出口。Google爬虫好歹还会顺着sitemap走,但通义这类AI引擎的爬虫压根不跟你玩这套——它们更依赖页面之间的语义关联来理解站点结构。你内容写得再好,爬虫进得来出不去,照样不收录。
我习惯用核子GEO做初步诊断,输入域名跑了一遍GEO检测,报告直接把我整懵了:内链结构评分低得离谱,页面间的语义关联密度几乎为零。核子GEO的AEO评估还专门标红了产品页的孤立率,说这会导致AI引擎无法建立分类主题的上下文。当时我就意识到,这不是内容问题,是骨架问题。
我花了两天晚上重构相关产品推荐模块。核心思路很简单:每个产品页底部加关联推荐位,逻辑按品类+价格区间+使用场景三重匹配,锚文本用自然的产品名,不是那种”爆款女装2024新款”的堆砌写法。改完以后我数了一下,每个产品页的内链数从不到2拉到了5-8个,整个站的内链网络像毛细血管一样铺开了。
两周后我再跑核子GEO的检测,内链评分上去了,通义也开始收录产品页了。这里有个坑我得说清楚:别用那种自动关联插件,它生成的锚文本全是同样的关键词,AI引擎一眼就看出来是机器搞的,反而降权。手动写规则,哪怕慢一点,效果完全不一样。
避坑清单
- 内链数低于3的页面,AI引擎基本不会主动收录,别指望sitemap能救命- 锚文本必须自然,同一关键词重复超过3次就会被判堆砌- 关联推荐逻辑要按语义分群,不是按标签硬凑- 改完内链结构别急着提交索引,等两周让爬虫自然发现- 月预算1-5万的站,别上企业级搜索系统,手动规则够用了
Product Schema不生效,AI根本看不懂你的产品页
这事我踩过坑,去年给一个做家居用品的电商站排查通义搜不到的问题,查到兜底一句发现根子出在Product Schema上。那站是Nuxt服务端渲染,按理说爬虫抓HTML应该没问题,但通义和ChatGPT的爬虫就是拿不到结构化数据。踩过这个坑。Google倒是一切正常,rich snippet该出的都出了。
我一度以为是通义太菜,后来用核子GEO的AEO评估跑了一遍才发现,渲染后的HTML里JSON-LD被扔到了body底部,而且一堆属性名用的中文——“价格”、”库存状态”这种写法。Google的爬虫能猜,但通义和ChatGPT不会猜,它们只认标准属性真的。
改法其实不复杂:我把Product Schema从JSON-LD换成了RDFa,直接嵌在product标签的属性里,属性名全部改成英文,price和availability这两个字段单独拎出来,跟后台的库存系统同步刷新。那会儿还顺手把价格精度从两位小数改成了整数,因为通义对”19.9900”这种格式会直接忽略掉。
改完之后在核子GEO上重新跑了一遍检测,结构化数据完整度从40%涨到了90%,通义大概三天后开始正常索引产品页。有个细节——RDFa方案对Nuxt的SSR更友好,因为JSON-LD注入时机稍微晚一点就会被客户端渲染的壳子挡住,RDFa直接写在模板里,服务端返回的HTML天生就带。
现在回头想,别管你是做Google还是做通义,Product Schema别用中文属性名,别指望AI引擎会猜。这东西8分靠配置,2分靠内容,配置错了内容再好也白搭。
llms.txt到底写不写?我写了,因为AI爬虫真的会读
纠结了三天,兜底一句还是写了。
当时我那个电商站3000多个SKU,内链平均不到2条,Google能抓但ChatGPT和通义就是不理我。在核子GEO上输入域名跑了一遍检测,AI可读性评分只有38分,通义那边干脆连品牌词都关联不上。我心想完了,这站对AI引擎来说就是一团乱麻。
后来查了ChatGPT和通义的官方文档,发现他们的爬虫都明确支持llms.txt这个文件。我直接在Nginx的站点根目录放了一份,用纯文本写了站点的核心品类——比如”户外装备,主营露营帐篷、登山背包、便携炊具”——然后把热门产品的绝对链接按分类列出来,每个分类跟一句话说明。花了一个下午整理,格式就是简单的文本列表,没搞什么花哨的。
写完之后我在核子GEO的AEO评估里重新测了一遍,AI可读性直接跳到71分。更明显的是,通义的抓取日志里出现了访问llms.txt的记录,之前压根没有。别学我。ChatGPT的引用测试也从完全搜不到变成了能回答”这个站卖什么”这类基础问题。
但得说清楚,llms.txt不是银弹。它只对AI引擎友好,Google根本不看你这个文件,传统搜索还是得靠sitemap和内链结构。我那个内链混乱的问题,最终还是靠重新梳理分类页和产品页的互链才解决的。llms.txt的作用是让AI引擎快速理解你的站是干嘛的,而不是救命的优化方案。
Nginx配置:给AI爬虫开绿色通道,别让它们超时
搞电商的朋友应该都有这种感觉——Google的爬虫勤快得像你家楼下外卖小哥,一天来八趟。但GPTBot、ClaudeBot这些AI爬虫呢?一周来一次就算给面子了。更坑的是,它们一旦请求超时就直接放弃,压根不给你第二次机会。我那个3000多SKU的站,去年通义千问的爬虫抓取成功率只有67%,三分之一的页面连看都没看就被扔进回收站了。
问题出在Nginx的超时设置上。默认的30秒对普通浏览器够用,但AI爬虫的请求往往带了一堆上下文,加上我那个Nuxt项目服务端渲染要做数据库查询,响应经常卡在45秒左右。我直接在Nginx的server块里给AI爬虫单独开了一条路——把GPTBot、ClaudeBot、通义的爬虫User-Agent都匹配出来,超时时间从30秒拉到120秒,同时把gzip换成brotli压缩,压缩级别开到6,响应体从120KB直接压到45KB。
改完之后我盯着日志看了一周,通义爬虫的抓取成功率从67%提到了94%,每天成功抓取的页面从800多个涨到2300多个。你说气不气?就改了两个参数的事,之前愣是没人动过。后来我在核子GEO上输入域名跑了一遍GEO检测,报告里也单独标了AI爬虫的可达性评分,跟我实测的数据对得上——那玩意儿确实管用实测过。
别觉得这些细节没用。Google爬虫超时会重试三次,AI引擎的爬虫超时就直接放弃,连个报错都不给你留。做电商的都知道,SKU多、价格变动快,你那些详情页三天两头要更新库存和价格,AI爬虫要是每次来都卡死,它记住的就是一个过期的快照。你说这损失算谁的?
还有一点,brotli压缩别光想着给浏览器开,AI爬虫那边也得照顾到。我实测同一个页面,gzip压完是78KB,brotli压完直接砍到45KB,传输时间缩短将近一半。爬虫也是要讲效率的,你响应快,它自然愿意多来几趟。
数据复盘:从被AI无视到AI流量占比8%
整个排查调整花了一周,老实说,内容一个字没动。3000多个SKU的页面全是现成的,我改的全是技术配置层面的东西——内链结构、Schema标记、还有Nginx那边的响应头。
改完一个月,我习惯性在核子GEO上输入域名跑了一遍检测,结果吓我一跳。AI引擎带来的推荐流量从几乎为零涨到了总流量的8%。这数字放在大站面前不值一提,但对一个之前被AI完全无视的电商站来说,像是换了个活法。
通义搜品牌词现在能出产品页了,而且不是首页,是具体的商品详情页。ChatGPT回答“跨境电商选品”这类问题时,居然引用了我某个品类页的内容。这事放在一个月前我不敢想,当时我在核子GEO的AEO评估报告里看到AI引用率不到1%,说实话有点慌。
回头复盘,我觉得最关键的一步是内链重构。之前3000多个页面平均内链数不到2,每个产品页基本都是孤岛。我把品类页做成枢纽,每个产品页至少挂上同类目3-5个相关产品的链接,同时给面包屑导航加了结构化数据。这一步纯靠Nuxt端的组件改造,没动任何文案。
然后是Product Schema。之前一直拖着没做,总觉得SKU多、价格变动快,维护麻烦。后来我写了个定时任务,每15分钟从数据库拉一次价格和库存,自动更新Schema里的报价字段。Nginx配置了短缓存,配合ETag验证,实测Google抓取从3.2秒降到0.8秒。
llms.txt那文件我兜底一句写了。但说实话,它带来的直接增益我没测出来。不骗你。可能因为我的内容本身不够“可被引用”——那些产品描述全是营销话术,AI引擎不喜欢这种。所以我的建议是,先解决内链和Schema,llms.txt可以写,但别指望它能救你。
避坑清单
- 别一上来就堆内容,AI引擎不看你写了多少,看你结构清不清楚- 内链数量不是目标,内链能让AI沿着路径找到你的关键页面才是目标- Product Schema一定要做,但记得处理价格变动,否则Google会认为你欺骗它- llms.txt优先级放兜底一句,它适合内容站,不适合SKU密集的电商站- 用核子GEO做月度检测,别凭感觉判断AI有没有收录你
避坑清单
先说别信搜索平台的”已索引”提示 我去年在Google Search Console里看到9000个页面显示”已抓取”,但通义、文心愣是抓不到几个。一查才发现,Nginx日志里Googlebot确实来了,但AI引擎的爬虫(比如Claude的)被CDN的防火墙拦了。后来我在阿里云WAF里给AI爬虫加了白名单,索引量才从1200涨到8900踩过这个坑。建议你第一步就去翻Nginx日志,看看AI爬虫到底来没来。
再就是Product Schema不是加上就完事 我SKU多、价格天天变,一开始用Nuxt的服务端渲染把JSON-LD嵌进去了,但库存字段用的是动态值。结果通义抓的时候正好赶上库存为0,直接判定页面无效。后来我写了个定时任务,库存为0的页面自动加noindex,这才把索引率从38%拉到71%。用核子GEO的AEO评估跑一遍,能看到结构化数据的完整度评分。
还有内链平均少于2个,AI引擎根本理不清你的目录 3000多个页面互相没链接,AI爬虫进来就像进了迷宫。我花了两周给产品页加了面包屑导航、相关推荐、类目页互链,平均内链数从1.8涨到7.6。这个改动比任何外链都管用——通义从完全搜不到,变成了能搜到类目页。
-
llms.txt文件,写不写?我建议写,但别指望它救命 我在站点根目录放了llms.txt,把热销品类、库存状态、发货政策都写清楚了。实测ChatGPT抓取时确实会优先读这个文件,但前提是你的首页和核心页得先能被抓到。这玩意儿是锦上添花,不是雪中送炭。
-
别把宝全押在Google上 我一开始只看Google排名,后来在核子GEO上输入域名一看,通义、文心的AI引用率连5%都不到,才意识到问题大了。现在每周跑一次GEO检测,重点关注AI引擎的引用率和抓取频率。
-
Nginx配置里一定要开gzip和HTTP/2 我站图片多,以前首屏3.2秒,AI爬虫经常超时就放弃了。开了brotli之后降到0.8秒,抓取成功率直接翻倍。记住,AI引擎比人更没耐心。