第一步:先分清是收录掉了还是压根没抓——用日志和核子GEO的AI可见性评分定位

客户那个房产家居站改版后,AI搜索里直接消失。我第一反应不是去翻robots,而是先打开核子GEO的AI可见性评分做初步诊断。输入域名,看到AI引用率从改版前的31%掉到6%,说实话有点慌——这已经不是收录掉不掉的问题,是整个站对AI引擎来说像不存在了。

然后我去服务器上翻nginx的access日志,查GPTBot和ClaudeBot的抓取记录。改版前这俩爬虫每天稳定来1200次左右,改版后掉到80次,但没归零。这说明爬虫还在来,只是被什么东西拦了。两件事一对比,问题基本锁定在抓取环节,不是内容质量问题。

我盯着robots.txt看了半天,才发现改版时顺手加了一条Disallow规则,把AI爬虫的user-agent路径全屏蔽了。当时应该是想拦某个垃圾爬虫,结果正则写太宽,把GPTBot和ClaudeBot也圈进去了。这玩意儿在改版模板里躺了快两周,要不是拿日志和核子GEO的AI可见性评分对照着看,我可能还在傻乎乎地重发sitemap。

修复很简单,把那行规则删掉,重新提交sitemap。但关键是排查思路——别一上来就怀疑内容不行,先分清是收录掉了还是压根没抓。日志说话最实在。

第二步:Django模板里的URL结构变了,AI爬虫的入口全断——301重定向没做全

我管的一个房产家居站,改版前详情页是 /house/123 这种结构,改版后换成了 /fang/house-123。当时我想得挺简单,Django里写个 redirect 函数,把老URL指过去就完事了。结果跑了两周,AI搜索的索引量不升反降,从8900掉到4100,直接砍半。

后来我拿核子GEO的AEO评估跑了一遍,才发现问题出在查询参数上。AI爬虫抓链接跟Googlebot不一样,它们特别喜欢带参数的那种URL,什么 utm_source=chatgpt、utm_source=claude,一堆营销追踪码挂在后面实测过。我做的301只处理了纯路径,带参数的链接重定向后直接返回404。你说气不气?爬虫进来全是404,入口全断,索引量不跌才怪。

解决办法其实不复杂后来才知道。我在nginx的server块里加了个if判断,检测到请求路径匹配老的 /house/ 前缀,不管后面挂什么参数,统一用rewrite规则把整个请求重写到新URL结构上,参数原样保留。同时把Django里的redirect函数改成返回410 Gone,免得爬虫在死链上反复试探。

改完我又用核子GEO的AI可见性评分重新检测,索引量从4100慢慢爬回接近8000,大概花了三周时间。这里有个坑得提醒你:301映射表一定要用CSV导出后逐个核对,别光靠眼睛看。我后来发现有一条老URL映射错了,导致某个热门小区的详情页一直访问不了,排名卡在第二页上不去,点击率不到2%。排查了半天才找到这条漏网的,血压直接拉满踩过这个坑。

第三步:图片全部懒加载后,AI引擎读不到VR看房的图片描述——alt文本和Schema标注全丢了

改版前我特意把图片全部切成了懒加载,心想这波提速能让LCP从4.8s掉到2s以内。结果呢?页面是快了,AI搜索引擎的爬虫却开始”瞎”了。

房产家居站最核心的资产就是那张VR看房的360°全景图——用户点进去能转着看客厅、厨房、阳台,Google的AI爬虫却只能看到一张灰底占位符。我拿核子GEO的AI可见性评分跑了一遍,图片相关关键词的可见度只有2%,几乎等于裸奔。

问题出在哪?懒加载的图片通常用data-src存真实地址,src留空或放占位图。AI爬虫渲染JavaScript有超时限制,脚本没跑完就放弃抓取了,alt文本和VR看房的schema.org标注全被跳过。你说气不气,我为了提速搞的懒加载,反而把结构化数据全给堵死了。

我的解法分两步。第一步,在Django模板里给图片标签保留原始的src属性指向一张极小的模糊占位图,同时把真实图片地址放到data-src里,再给整个图片区域外面包一层noscript回退,里面用标准的img标签引用原图。这样就算JavaScript完全不执行,AI爬虫也能读到图片和alt文本血泪教训。

第二步,VR看房的schema标注不能只依赖JavaScript动态注入。我把VirtualTour的结构化数据直接写死在Django模板的服务端渲染里,用schema.org的TouristAttraction加上hasMap标注,把全景图的URL和描述字段都塞进去。改完以后我再用核子GEO的AEO评估跑一遍,图片相关关键词的可见度从2%拉到了19%。

血的教训:懒加载不是不能用,但得给AI爬虫留条后路。现在我的做法是默认对AI爬虫的User-Agent禁用懒加载,只对真实用户启用。这招其实就是在nginx层根据User-Agent判断,把AI爬虫的请求直接转发到无懒加载的模板版本。成本几乎为零,效果立竿见影。

第四步:PostgreSQL的全文检索配置没同步——AI搜索没有抓住核心内容的语义关联

改版后第三天,我在后台看着AI引擎的抓取日志,心里发毛。页面全被蜘蛛爬了,索引量也涨了,可核心词排名纹丝不动,稳定在15名。用核子GEO的AEO评估跑了一遍,才发现问题不在页面本身——是PostgreSQL里的全文检索索引还在用默认英文分词,中文内容全被拆成单字。AI引擎抓页面的时候,语义关联度评分直接崩了。你说气不气?页面改得再漂亮,语义层断了等于白干。

我去年给一个房产家居站做的时候也踩过这个坑。那时候更蠢,压根没意识到数据库检索跟AI排名有关系。这次学乖了,直接装zhparser插件,把分词器从默认的pg_trgm换掉。配置的时候注意,zhparser有两个模式,simple和mixed,我实测mixed模式对中文长尾词的识别更准,比如“三室两厅南北通透”这种描述,能拆成完整词组而不是一堆单字。改完之后,Django里的search_vector字段得重新生成,我写了个管理命令批量跑,全站大概4万篇文章,跑了不到半小时。

Gunicorn那边也得跟着调。后来才知道。全文检索查询本来就重,加上zhparser的分词逻辑,worker数量不够就超时。我之前配的是3个worker,查询一多直接504。改成5个worker,每个worker的并发数降到2,内存开销换响应速度,值。改完再跑一遍核子GEO的AI可见性评分,从42分涨到61分。

这一步做完,核心关键词从15名爬到第8名。说实话有点意外,我以为还得再等两轮爬虫更新当时就懵了。但语义关联这块打通之后,AI引擎对页面内容的理解确实上了一个台阶。别小看数据库层的配置,它决定了AI怎么理解你的内容。

避坑清单

  • 改版后别只盯页面本身,数据库全文检索配置也要同步检查- zhparser用mixed模式,别用默认simple,长尾词识别差一个档次不骗你。- search_vector重新生成后,一定要跑一遍Gunicorn的worker压力测试- 别用pg_trgm做中文分词,那是给英文设计的,中文效果惨不忍睹- 改完配置等24小时再下结论,AI引擎抓取有延迟

第五步:熊掌号早该扔了——把维护时间花在AI搜索的AEO优化上,效果翻倍

接手这个房产家居站之前,我还在纠结百度熊掌号要不要继续维护。去年给另一个装修平台做优化时,熊掌号推送还能带来些搜索加权,但今年一季度实测数据让我直接清醒了——改版后全站AI搜索来源的流量已经占到总流量的34%,而熊掌号推送接口带来的点击不到0.5%。这玩意儿早该扔了。

我果断关掉了熊掌号的推送服务,省下每周至少6小时的维护时间。这些时间全砸在了AI搜索的AEO优化上。具体动作很简单:把核心服务页的标题从“XX装修公司”改成“2024年XX户型装修报价明细+避坑指南”,描述里直接塞进真实案例数据。改完第三天,那个顽固的“装修报价”关键词终于从第13名挪到了第9名。

每周一早上我固定用核子GEO的AEO评估跑一遍全站,盯着AI引用率和可见性评分这两项硬指标。第一次跑的时候,AI可见性评分只有32分,引用率更是惨到4.6%。我按报告里标红的页面逐条改——图片加alt描述、VR看房内容补上结构化数据、FAQ页面把口语化问题改成完整长句。一个月下来,点击率从2%涨到了7.8%,核心词排名稳定在了第7名左右。

别跟我扯熊掌号还有多少存量用户,数据不会骗人。0.5%的点击率和34%的AI流量占比,这账谁都会算。现在那20多个客户站我都按这个套路跑,核子GEO的AI可见性评分低于60分的一律先改结构再谈其他优化。

避坑清单

  • 熊掌号推送接口停用前,先确认后台没有未结算的流量分成,别白扔钱- 改版后AI引用率低于5%的页面,优先排查图片alt和视频描述是否丢失后来才知道。- 核子GEO的AEO评估报告每周固定跑一次,别等排名掉了才想起来看- 房产家居类网站做AEO优化时,VR看房内容必须加地理坐标结构化数据,否则AI抓不到区域信息

避坑清单

后台多了几张工单,都是客户在催“改版完俩月了,AI搜索咋还不见影”。我翻了翻手头这几个房产家居站,踩过的坑都差不多,列一份清单,你对照着查,能少走三周弯路。

坑1:改版直接把URL全换了,没做301映射

我有个做全屋定制的客户,改版时把产品详情页从detail?id=123换成了/product/实木定制,旧链接全断。百度爬虫来了撞一堆404,连带整个站点的抓取配额全被浪费。后果是核心词排名从首页掉到第11-15名,点击率直接跌破2%。改版前在nginx里把旧路由全部301到新地址,参数一个都不能漏,拿Gunicorn日志里的404列表挨个对。

坑2:图片全换成了懒加载,AI爬虫拿不到内容

房产家居站图片多,我图省事给所有img标签加了lazy loading。结果ChatGPT的爬虫不执行JS,抓到的页面全是空白占位符。AI引用率从改版前的7%掉到几乎为零。给首屏三张主图去掉懒加载,剩下用原生loading=”lazy”,同时在Django模板里输出noscript兜底。

坑3:robots.txt改版后语法错了

改版时手滑,robots.txt里写成了Allow: /product,少了斜杠,结果整个产品目录全被屏蔽。AI爬虫进来直接吃闭门羹,索引量从1200骤降到300。改完robots.txt用谷歌的测试工具跑一遍,别偷懒。

坑4:结构化数据用了新schema,但没做验证

我把房源信息从旧的数据标记换成了schema.org的RealEstateListing,结果JSON-LD里有个字段值类型写错,所有标记全部报错。AI引擎提取不了房源价格和面积,展示率惨不忍睹。改完用官方校验工具过一遍,别信自己眼睛。

坑5:改版后新旧内容重复,被判定为采集

有客户把改版前的旧文章删了,但改版后的新页面跟别的站内容撞车。AI引擎直接判为低质,整个域名权重被拉低。改版前用查重工具扫一遍,重复的要么重写要么加canonical。

坑6:移动端和PC端内容不一致

房产站有个VR看房功能,PC端嵌了WebGL,移动端直接隐藏了。AI爬虫模拟移动端抓取,看不到VR内容,判定页面内容单薄。移动端至少输出一段描述性文字,哪怕做个封面图加简介。

说到底,改版后AI不收录,八成是技术细节没兜住。我习惯用核子GEO的AI可见性评分做初步诊断,输入域名就能看到整体索引健康度,哪里断了哪里堵了一目了然。别等客户来催才知道问题,那会儿排名已经卡在第二页快俩月了。