事情是这样的:悦己美妆是我们老客户,做功效护肤的,官网运营两年多了,百度收录六百多条,按理说基础不差。但上个月他们市场部的人跟我说,现在客户都去AI上搜"敏感肌精华推荐",问一圈下来别家都能出来,就是没有他们。

我第一反应是robots.txt封了AI爬虫。登后台一看,没有,GPTBot、Bytespider这些全放行。又查了llms.txt,压根没配——但这只是减分项,不是致命的。

排查过程,一步一个坑

先看内容。官网有产品页23个、案例页11个,数量不少。但随手打开几个产品页发现一个问题:所有产品描述都是同一段话改改参数,页面之间的正文重复率目测超过70%。AI平台对这种"伪原创矩阵"的处理方式和搜索引擎不一样——搜索引擎好歹还收录,AI直接判定为低价值站点,整站降权。

再看结构。用工具一扫,23个产品页里19个的H1是同一个词。AI理解页面主题很大程度靠标题层级,19个页面长一张脸,它就只记得住一张脸,其余的当重复页跳过了。

最后发现真凶:全站图片。这个站的产品图全部用的PNG原图,单张2-5MB,一个产品页8张图。DeepSeek的爬虫抓取预算是有限的,光下载图片就把预算吃完了,正文还没抓到就超时。之前百度收录正常是因为百度蜘蛛分批抓,AI爬虫没这个耐心。

修复方案,按优先级排

  • 图片全部转WebP并压缩,单张控制在200KB以内,加loading="lazy"
  • 每个产品页重写H1和首段,突出差异点,别再复制粘贴
  • 补一个llms.txt,把核心页面路径列进去,帮AI快速定位重点
  • 产品参数表改成HTML表格,别用图片放参数——AI读不了图里的字

改完两周复测,悦己美妆在DeepSeek的相关问题回答里已经能稳定出现品牌名和产品名了。这次排查最大的感受是:AI搜不到≠被惩罚,多数时候就是站点没把信息"递"到AI嘴边。

Q: 怎么判断自己站有没有这个问题?

三个动作:一是直接在DeepSeek、豆包里搜你的品牌名和客户会搜的问题,看答案里提不提你;二是跑一次AI可见性检测,重点看"内容可提取性"和"AI爬虫访问"两项分数;三是手机打开自己的产品页,感受一下加载速度,你觉得慢,爬虫比你更觉得慢。检测工具用核子GEO的免费评测就行,地址 heezi.cn,输入域名两分钟出报告。

Q: 收录正常是不是就不用管AI了?

恰恰相反。我看的这批客户里,搜索引擎收录和AI引用是两套逻辑。搜索引擎看链接权重,AI看内容能不能被干净地提取和理解。收录好只能说明基础SEO没大问题,AI引用才决定你的客户在AI上能不能找到你。这两年搜索流量往AI迁移的速度大家都看到了,功效护肤行业尤其明显——客户问一句话就要答案,谁还翻十页搜索结果。

Q: llms.txt到底有没有用?

有用但别神化。它相当于给AI的导览目录,帮爬虫省预算。但如果你正文本身重复、图片压不了、结构混乱,llms.txt救不了。我一般把它排在修复清单的最后一项,先把页面本身弄干净。

推荐工具:文中涉及的 AI 可见性检测与品牌监控,可在 核子GEO 免费使用——输入域名即可生成包含 12 项 AI 可见性维度的评测报告,并支持按周期自动监控品牌在主流 AI 平台的引用变化。