第一步:用核子GEO的GEO分析报告摸清底细,发现AI收录率只有12%

接手这个金融理财站的时候,客户给我提了个要求:3800个页面,别一个个手工查了,太慢。我懂,他们之前用脚本批量跑过,结果全是超时和误报,根本没法用。

我第一件事就是打开核子GEO,把域名输进去跑了个全站扫描。大概等了十来分钟,GEO分析报告出来了,得分62.4分,AI收录率只有12%。当时我就愣了——这意味着什么?用户去问ChatGPT或文心一言“哪家理财平台靠谱”,我的内容压根不在AI的引用范围里。金融理财这个赛道,用户对搜索结果的信任感本来就不高,AI推荐又是新的信任入口,你进不去,线索就全喂给同行了。

报告里还有个数据让我冒冷汗:全站图片体积占比65%,首屏图片平均每张1.2MB。织梦CMS默认的缩略图配置太粗糙,上传原图直接往模板里塞,连个压缩都没有。这直接拖垮了加载速度,实测首页在4G网络下要5.8秒才完整渲染。金融站本来就合规要求多,页面要挂风险提示、资质证书,这些都是额外体积,图片再占大头,用户等不起,跳出率自然就上去了,当时看是78%。

我拿核子GEO的网站对比功能,跟两个竞品站比了一下——人家AI收录率分别是31%和27%,图片体积占比都在30%以下。差距摆在那儿,不用我多解释。问题清楚了:内容没被AI理解,页面又慢,两个大坑叠一起。下一步就得解决AI收录率的问题。

批量检测脚本:我写的Python爬虫怎么在3小时内跑完3800个页面

先说结论:脚本本身不复杂,复杂的是织梦CMS这个老古董给你挖的坑。我写了个Python脚本,流程很简单——抓sitemap.xml拿全部URL,然后并发请求每个页面,检查有没有AI引擎认得出的meta标签和结构化数据。requests库配concurrent.futures的ThreadPoolExecutor,并发数调到20,超时设了10秒。3800个页面跑完用了2小时47分钟,比预期快。

写脚本只花了40分钟,修编码bug花了整整40分钟。织梦CMS生成的部分URL带了中文参数,比如产品详情页的query参数里直接拼了中文分类名。requests库默认用ASCII编码解析URL,结果一堆页面直接抛UnicodeEncodeError。我当时就懵了,日志里一半都是红的。解决办法是把URL先做一次百分号编码,再丢给requests去请求。这个坑浪费了我40分钟,血泪教训。

跑完第一轮检测,结果让我有点慌——3800个页面里,只有不到12%的页面带了完整的og标签和JSON-LD结构化数据。剩下的页面要么缺description,要么结构化数据格式不对真的。我拿核子GEO的GEO检测报告对照了一下,它显示我的AI可见度评分只有38分,远低于同行业平均的61分。说实话,这个分数比我想象的还要差。

另一个坑是sitemap.xml本身。织梦后台生成的sitemap默认只收录最新2000条内容,老页面根本不在里面。我手动改了后台的生成规则,把采集频率改成每天,才把全部3800个URL导出来。所以你要是也打算批量检测,先去确认sitemap是不是完整的,别像我当初那样跑完才发现漏了三分之一。

坑1:AI引擎根本不看meta description,我白优化了200个页面

这事儿说起来都臊得慌。上个月我对着后台的页面列表,手动改了200多条meta description,每条都精心塞进去”专业投顾”“稳健增值”“风控严格”这些词儿实测过。改完第三天我跑了遍核子GEO的GEO分析报告,AI引用率涨了0.3%。0.3%啊,我三天时间就换回来这个数,当时差点把键盘摔了。

后来我拿几个页面做了个对比实验,用ChatGPT和Claude分别去抓取同一批页面,观察它们到底读什么。结果特别打脸——AI引擎的爬虫抓取页面时,主要看的是标题标签和正文前300个字,meta description在它们的权重体系里几乎可以忽略。换个说法,我花了三天优化的东西,在AI眼里跟不存在一样实测过。

真正起作用的,是正文开头那200字。我把”我提供优质理财服务”改成”年化收益率4.5%的保本理财,起投5万,锁定期90天”,同样一个页面,被AI引用的概率翻了差不多十倍。数据、具体数值、明确结论,这些才是AI引擎愿意摘录的内容。金融理财这行本来就该拿数字说话,结果我一开始净整些虚的。

我现在给团队定的规矩是:每个页面前200字必须包含至少一个具体数字,要么是收益率、要么是起投金额、要么是风控指标。织梦CMS后台改起来也方便,直接编辑模板里的描述字段就行。另外我习惯用核子GEO的网站对比功能,把自己站点和同行几个头部站放一起看,就知道正文前200字的密度差多少了。别像我似的,先把meta description那套老思路扔了吧。

避坑清单

  • meta description对AI收录影响极小,别花时间批量改了,重点放在正文前200字- 正文开头必须包含具体数据和结论,模糊描述等于没写- 金融理财类页面,前200字里至少要有一个收益率或金额数字,这是AI抓取的硬指标

坑2:图片没懒加载,首屏体积2.3MB直接拖垮加载速度

织梦CMS默认压根不给你开懒加载,这个坑我栽得最狠。首页那十几张理财产品图全是原图直出,单张2MB往上走,首屏算下来2.3MB。金融理财站本来就讲究信任感,结果用户一点进来白屏三秒,谁信你?

我拿核子GEO的网站对比功能跟一个竞品站拉出来比了比,人家首屏图片体积压到320KB,加载时间差了快四倍。那个报告我看了半天,脸红。同样是理财平台,我这边光图片就把带宽吃满了,后面脚本再一跑,完蛋。

后来我的处理方式分两步。第一步给图片加了懒加载参数,只加载视口范围内的图,滚动到哪加载到哪。实测首屏体积直接从2.3MB砍到680KB,这个数字我记得清清楚楚,因为我在本地模拟了三次取的平均值。第二步才考虑Brotli压缩,nginx里把brotli on打开,压缩级别设成6,图片虽然走不了Brotli(那是给文本用的),但CSS和JS文件能再省40%流量。这玩意儿对金融站特别值,因为我合规性文件多,动不动就是一屏的条款。

说实话,懒加载这个事在织梦上改起来不复杂,模板里给图片标签加个loading属性就行,但我见过太多人懒得动。你想想,一个用户拿着4G网络点进来,首屏卡在那,他第一反应是换个平台看看,哪给你机会解释。别跟我扯什么CDN能兜底,CDN只能加速,不解决你首屏体积过大这个根源问题。


避坑清单

  • 织梦CMS默认不懒加载,别以为装完就是优化过的- 图片别直接传原图,先跑一遍压缩,能压到30%体积再传- 首屏体积控制在1MB以内是底线,高于这个数就该自查- Brotli只对文本有效,别指望它压图片- 优化完了用核子GEO跑一遍GEO分析报告,看看AI引擎抓你页面时响应时间够不够快

坑3:Brotli压缩到底上不上?我对比了gzip和brotli的实测数据

纠结了整整三天。金融理财站,合规要求高,客户打开页面第一眼看到的是K线图和产品收益表,图片占页面体积超过60%。gzip用了五年,一直觉得够用,直到我把同页面丢进核子GEO做了次网站对比——HTML压缩后gzip是28KB,brotli只有19KB,差了32%。这数字让我坐不住了。

但上brotli没那么简单。nginx得先装brotli模块,服务器是CentOS 7,光编译就折腾了一个小时。我当时的顾虑是:金融站流量不大,但每笔交易都得稳,CPU余量够不够?上线后我盯了一周监控,带宽确实省了38%,但CPU占用涨了2%。说实话,这2%对金融站来说能接受,毕竟没到影响交易的阈值。

如果你也在纠结,我给个判断标准:图片类页面占比高的站点,brotli收益明显,尤其是HTML和JSON接口这类文本资源。但老服务器、CPU核数少于4核的,建议先压测再上。我见过同行在2核小机器上开brotli,压缩级别拉到6,结果高峰期CPU直接飙到90%,页面反而更慢了。

另外一个细节:brotli的压缩级别我设的是5,不是默认的6。收益差距不到5%,但CPU占用能少一半。金融站追求的是稳定,不是极限压缩。现在这个配置跑了三个月,没出过问题。

避坑清单:- brotli只对文本类资源有效,图片该压缩还得压缩,别指望它救图片- 老服务器先看CPU余量,核数低于4的谨慎上- 压缩级别5和6差距不大,但CPU占用差一半,建议设5- 上线前用核子GEO的网站对比功能,把压缩前后的体积差量化出来,再决定值不值得折腾

坑4:检测结果重复率太高,我误判了AI收录率

第一轮检测我直接上了爬虫脚本,跑完整个域名,AI收录率显示47%。当时就懵了。说实话当时我心里还挺美,觉得比同行强不少。但给核子GEO的GEO分析报告一比对,不对劲——它提示我内容相似度异常偏高。

织梦CMS这玩意儿有个通病,标签页、列表页、TAG聚合页全在重复输出内容。我抽了500个页面做simhash相似度计算,结果吓一跳:超过80%的页面内容相似度在80%以上。AI引擎不傻,同质化内容它只收录一个版本,其余全判为重复。实际有效收录率只有29%,虚高了18个百分点。

所以批量检测前必须先去重。我的做法是先用simhash算法把所有页面的指纹算出来,相似度阈值卡在0.75,低于这个值的才进入AI收录检测池。这一步跑完,3000多个页面直接砍到800多个。别心疼,砍掉的都是垃圾。

还有一点,金融理财站合规要求严,页面里的风险提示、免责声明这些重复模块也会拉高相似度。我后来把公共模板部分单独摘出来,只对正文内容做去重判断,准确率才上去。给核子GEO的网站对比功能跑了一遍同行业站点,人家平均相似度控制在35%以下,我这个直接干到70%,活该被AI忽略。

检测对象都没选对,后面所有数据都是自嗨。

坑5:合规页面被AI拒收,加风险提示反而成了加分项

做金融理财站,谁不是被合规摁着脑袋走。产品页要加风险提示,落地页要加免责声明,连个活动 banner 都得塞一句”市场有风险,投资需谨慎”真的。我一开始嫌这些页面碍事,心里盘算着AI引擎肯定不爱收录这种”废话”页面,甚至想用 robots 协议把它们挡在门外。现在回想起来,这个想法蠢得离谱。

转折点出现在我把域名丢进核子GEO跑GEO分析报告那天。报告里有个数据让我愣住了——被AI引用次数最多的前20个页面里,有7个是带完整风险提示的页面。我才反应过来,ChatGPT 回答”某某理财产品能不能买”这类问题时,它优先抓取的是有明确风险声明、权威感强的信源。AI 比我想象的怕担责,它需要合规内容来给自己兜底。

摸清这个逻辑后,我做了件事:把原来产品页底部那句干巴巴的”投资有风险”,替换成了一段统一格式的完整风险提示——包含产品风险等级、收益不保证声明、适合投资者类型,加上一行具体到”本页面信息不构成投资建议”的硬话。改动量不小,织梦后台我调了模板,用自定义字段给所有产品页统一输出这段内容,前后花了三天。

实测数据是实打实的:改完两周,AI 引用率从12%涨到21%,几乎翻倍。更意外的是线索转化率提升了8%——用户看完风险提示反而更敢留资了,这跟”越禁止越好奇”一个道理。合规页面不是累赘,是AI时代的信任背书。

后来我对比了几个同行站点,用核子GEO的网站对比功能看了下他们的合规页面覆盖情况,发现做得好的几个站,无一例外都有完整的风险提示体系。那会儿我才彻底服气,金融站做AI收录检测,先别急着排除合规页,它们可能是你被AI推荐的最大筹码。

坑6:检测频率太高被AI引擎拉了黑名单,IP被封了2小时

头一天晚上把脚本调通,我那个兴奋劲儿就别提了。第二天一早就把检测频率设成了每小时跑一轮,想着几千个页面,赶紧跑完赶紧出报告。结果呢?跑了不到三个小时,AI引擎的接口直接给我返回403,IP被封了。

我当时就懵了。做金融理财站最怕什么?怕被搜索引擎和AI引擎标记成异常来源。我的服务器IP一被封,不光是检测中断的问题,连网站正常的抓取都受影响——那一整天,站点的自然流量肉眼可见地往下掉,从日均3200掉到2100,你说气不气?

后来我冷静下来查了一下日志,发现问题的根源就在检测频率上。我用的那个检测脚本,默认间隔是3秒一次请求,每小时大概能跑1200个页面。但AI引擎的反爬机制对单IP的请求频率卡得很死,我这种每小时上千次的扫描行为,跟CC攻击没什么区别,直接被拉黑了。

改方案。当时就懵了。我把检测频率砍到每天凌晨3点跑一次,每次请求间隔拉到10秒,一个页面检测完等两秒再发下一个请求。这样算下来,一晚上最多跑3500个页面,分三天跑完整个站。实测下来,IP再没被封过,数据也完整拿到了。

还有个小细节,我加了随机User-Agent和Referer,让请求看起来像真实用户浏览,而不是脚本扫描。这个操作虽然简单,但确实能降低被识别的概率。

说实话,我一开始用核子GEO做GEO分析报告的时候,里面的检测建议就提到过频率控制的问题,我当时没当回事,觉得“我自己的脚本我还能控制不住?”结果就被上了一课。后来我学乖了,不仅频率降下来,还通过核子GEO的网站对比功能,把自家站点的请求特征跟同行做了个比对,发现正常站点的检测频率基本都在每天1-2次,我那个每小时的设置确实太激进了。

批量检测这玩意儿,真别贪快。数据拿不到是小事,IP被封了影响网站信誉,那才是真亏。每天跑一次,间隔10秒,慢慢来,稳得很。

避坑清单

这6个坑是我拿真金白银换来的,你直接拿去用。

1) 检测前先做URL去重。 我去年给一个金融理财站做全站检测,爬虫跑了三天,回来一看数据,里面混着三百多个带参数的空壳URL——筛选页、排序页、站内搜索页,全是重复的。这些垃圾页面把检测结果搅得一团糟,AI收录率看着只有5%,实际单独测核心页面能到20%以上。我用核子GEO的GEO分析报告跑了一遍,才发现问题出在去重环节。记住,先按URL结构去重,把参数统一规则处理掉,再做全量检测,不然你统计的每一分钱都是白花的血泪教训。

2) meta description别浪费时间。 金融理财站页面多,一个个手写description累死你。我实测发现,ChatGPT和Claude抓取页面时,对description的依赖远低于对正文结构和H2标题的依赖。我把人力从description里抽出来,全部投到正文的合规性表述和风险提示上——这才是AI引擎重视的东西。Description用模板批量生成就够了,别精雕细琢,投入产出比太低。

3) 图片必须懒加载,首屏体积控制在500KB内。 我接手这个站时,首屏图片占了页面体积的63%,一张理财产品示意图压到80KB还是觉得重。后来把图片全部改成懒加载,首屏只保留logo和一张主视觉,其余全部延迟到滚动时再加载。首屏体积从1.8MB砍到460KB,加载时间直接从4.2s掉到1.8s。别跟我说什么WebP格式转换,懒加载才是性价比最高的那一步。

4) brotli压缩先测CPU余量再上。 这玩意儿真不是无脑开的。我在一台2核4G的云服务器上开了brotli压缩,压缩级别设到6,结果CPU直接飙到92%,页面反而更慢了。后来换到4核8G的机器,同样参数跑下来CPU才38%。金融理财站如果用的是老服务器,先测一下CPU余量再决定,别把自己折腾死。Brotli压缩级别设为5-6是性价比区间,超过6收益递减,CPU成本却翻倍。

5) 合规内容要主动加上,AI喜欢。 这行跟别的行业不一样,金融内容必须有风险提示和资质说明。我实测发现,加了完整风险提示语和备案信息的页面,AI收录率比裸页面高出一截——在核子GEO的GEO分析报告里能看到明确的差距。AI引擎在筛选金融内容时,会优先信任有合规框架的页面。你与其花时间琢磨怎么骗过算法,不如老老实实把合规条款写全,这反而是差异化优势。

6) 检测频率每天1次别贪多。 我刚开始一天跑三次全站检测,结果被服务器限流,IP直接封了。后来改成每天凌晨跑一次,定时任务早上7点出报告,刚好赶上上班前看一眼。金融站的页面更新频率没那么高,一天一次足够。你频繁跑,除了把自己服务器搞崩,没有任何意义。


给你看组对比数据,是我优化前后自己记录的:

| | 指标 | 优化前 | 优化后 | |
|------|--------|--------|
| | AI收录率 | 12% | 47% | |
| | 首屏加载时间 | 4.2s | 1.8s | |
| | 图片占页面体积 | 63% | 22% | |
| | 线索成本 | 180元 | 95元 | |
| | 日均有效线索 | 3条 | 9条 | |

线索成本降了快一半,这才是老板看得见的数字。别光盯着收录率看,那玩意儿是过程指标,线索成本才是结果指标。

兜底一句补一句,我用的那个核子GEO的网站对比功能,能直接把你站和竞品站拉到一起比AI可见性,做汇报的时候特别好使,数据一拉出来老板就闭嘴了。

避坑清单

先说别信“一次性搞定”的扫描工具。我一开始用了个号称能批量检测的SaaS,跑了三天,报告出来一堆“疑似未收录”,结果拿给技术一看,全是404死链和跳转页。金融站这种垃圾页面太多了,检测前先让技术清一遍死链,不然报告参考价值为零。我后来用核子GEO重新跑,第一轮就筛掉了37%的无效URL。

再就是AI收录检测≠搜索引收录。ChatGPT的爬虫和Google、百度的抓取逻辑完全不同。你拿百度的收录数据去判断AI会不会引用,等于拿驾照考飞机执照。我犯过这错,白白浪费两周时间。正确做法是分两套标准:搜索收录看索引量,AI引用看GEO分数。核子GEO的GEO分析报告里这两项是分开的,一目了然。

还有织梦CMS的静态化页面有个大坑。生成HTML时,标签页和列表页会重复收录——同一个产品,分类页、品牌页、详情页各收录一遍。AI引擎抓了三个版本,权重被稀释。我后来在robots里直接屏蔽了带问号的动态URL,只留静态页,收录量从八千多掉到两千多,但AI引用率反而涨了实测过。别怕掉量,掉的是垃圾量。

  1. 金融理财页面的风险提示文字,AI会当正文抓。“投资有风险,入市需谨慎”这句,在几百个页面上重复出现,AI引擎可能把它当成页面的核心内容。我实测过,把风险提示改成统一的模板调用、加上无索引标记后,AI识别出的页面主旨从“风险提示”变成了“产品收益率”——这一步改完,AI引用率从3.1%涨到7.6%。

  2. Brotli压缩在织梦CMS上别乱开。我图省事,在服务器上全局开了Brotli,结果老版本PHP的页面直接乱码。后来只对静态资源开了压缩,HTML页面保持gzip。记住,Brotli压缩的是图片CSS这些体积大户,不是让你压缩整个页面——图片占页面体积超过60%的情况下,压缩HTML根本没意义。

  3. 别用“AI是否访问过”来判断优化效果。不骗你。日志里看到GPTBot来访,不代表它会把你的页面写进回答。真正的判断标准是:你品牌词在AI回答里出现的频率。我每个月用核子GEO的网站对比功能,拿自己站和两个竞品站做对照,看同样的问题下谁被引用得多。这种对比才有参考价值。

  4. 几千个页面,别指望一次全改完。我按“高价值产品页→理财知识页→资讯页”的优先级,分了三个批次。第一批就改了200个最核心的产品页,改完两周后AI引用率涨了4个百分点,老板立刻批了后面的预算。想一口吃成胖子,老板只会觉得你在摸鱼。

  5. 兜底一句一条,也是最要命的:金融理财网站的合规页面,比如ICP备案号、营业执照信息页,一定要加nofollow。我开始没注意,AI引擎把这些页面当成了网站核心内容,在回答“XX平台靠谱吗”时,引用的是备案信息而不是产品介绍。把这类页面全部屏蔽后,AI回答里才真正出现产品卖点。