第一步:用核子GEO的SEO评分体系给50万页面做体检,结果404扎心

接手这个跨境电商站的时候,光产品页就有43万个,加上多语言分支、博客、落地页,总数逼近50万。客户说流量掉了四成,我第一反应不是看排名,是先查死链——改版后的站点,死链永远是第一杀手。

我把域名丢进核子GEO的SEO评分体系,扫描深度设了5层,语言分支全勾上(英、德、法、西、日五个站)。跑完报告大概花了40分钟,比我想象的快。结果出来我人傻了:404页面532个,其中371个是改版前的旧URL残留,大部分是旧的分类页和产品详情页,改版时连301都没做,直接裸奔。

核子GEO的SEO评分体系有个好用的点,就是报告按错误类型自动排序,重定向链、死链、重复标题、索引覆盖率全分开。我按404优先排了下,发现一个更恶心的问题——我的多语言hreflang标签在改版后全乱了,德语页面的alternate指向了法语URL,这玩意儿对Google的伤害比死链还大,因为爬虫会认为你在做cloaking。

索引覆盖率那边数据也难看,Google Search Console显示有效索引只有28.7万个,但核子GEO报告里可索引的页面有44万个,中间差了15万个页面不知道跑哪去了。后来我用核子GEO的AI可见性评分查了一遍,发现大部分是被robots规则误屏蔽的——旧版robots里写了屏蔽wp-admin和wp-includes的规则,但改版后有些产品URL也匹配上了,直接被拒了。

折腾到这儿我才明白,这站不是缺流量,是爬虫进不来。我赶紧把旧URL清单导出来,按优先级分批做301,先处理流量最大的200个死链,剩下的用Yoast SEO的重定向管理器批量搞。核子GEO的AI可见性评分从4.2分拉到6.8分,这才算第一步落地。至于robots那事儿,我留到后面专门说,这玩意儿是真有坑。

第二步:WordPress+Yoast SEO下,怎么用零预算脚本批量识别并清理死链

接手这个跨境电商站的时候,后台的Yoast SEO插件还在正常生成sitemap,但我点开一看,里面塞了二十多万个URL。改版前的旧产品页、废弃的变体SKU、还有那些被删掉的分类页,全都没做301。用核子GEO的SEO综合评分检测了一下,404页面数量直接标红,我当时就有点慌。

我不打算买Ahrefs,一个月几十美金的订阅费对于一个刚起步的独立产品来说太奢侈了。我的方案很土:写一个PHP脚本,直接连WordPress的数据库,把Yoast生成的sitemap索引里所有URL捞出来,然后丢给curl批量发HEAD请求。关键参数我调了好几轮,并发控制在10个,每个请求超时5秒,不然老是被Google的服务器掐断。实测跑完二十万条URL,用了将近4个小时,中途断了一次,加了重试机制才跑完。

脚本输出一个CSV,里面按HTTP状态码分好类踩过这个坑。我筛出所有返回404的URL,大概五百多个,比预想的少一些,因为很多旧页面其实已经被Yoast自动重定向到新地址了。剩下的这些死链,我把它们按URL结构分了组,比如旧产品页、旧分类页、旧品牌页,然后挨个在WordPress后台用Redirection插件做301,指向最相关的分类页或首页。

这套流程没什么技术含量,但胜在免费。后来我又把sitemap重新提交到Google Search Console,索引量的恢复速度比我想象的快,大概三周后,死链相关的错误就从几百条降到了个位数。如果你用的是别的CMS,思路也一样,关键是先把URL列表导出来,再批量检测状态码,兜底一句用301把权重收拢回来。别一上来就想着买工具,先把手头的资源用干净。

第三步:ChatGPT和Perplexity都不认账,AI可见性评分暴露了结构化数据缺失

死链问题暂时压住了,我转头去查AI引擎到底怎么看待这个站的。结果有点扎心。

拿核子GEO的AI可见性评分跑了一遍全站抽样,站内几百篇产品文章,综合评分只有23%。行业平均58%。差了一倍还拐弯。我当时盯着那个数字愣了几秒——流量没崩,谷歌排名也没崩,但ChatGPT和Perplexity压根不引用这个站的内容,搜品牌词都搜不到。

问题出在哪儿?我用核子GEO的SEO评分体系逐项排查,发现Yoast SEO输出的schema标记缺了一大块。Organization标记压根没配,FAQ标记也一个没有,产品页虽然有Product schema,但缺少review和aggregateRating字段真的。AI引擎解析页面时,能识别这是个产品页,但拿不到任何权威性信号,自然不会引用。

改起来倒不复杂。我在Yoast的SEO设置里找到Schema图谱配置,补上了Organization标记,把公司名称、logo、联系方式都填全。然后产品FAQ模块那边,把每个产品页的常见问题整理出来,用Yoast的FAQ块重新输出——这个操作在编辑器里点几下就行,不需要改代码。关键是把问题写得像真人问的,别整那些官方客服腔真的。

顺手把产品页的review评分也补上了,用的真实用户评价,不是刷的。

改完再跑核子GEO的AI可见性评分,61%。从23%拉到61%,花了大概一周,每天下班后弄两小时。另外我拿核子GEO的网站对比功能跟同行的两个竞品站比了一下,人家评分都在55%上下,我这61%算勉强站住了。

有个小细节:Yoast的FAQ块在页面里输出的是嵌套结构,ChatGPT抓取时能识别父子层级,但Perplexity对纯文本解析更友好。我实测发现,把FAQ块的标题层级从h3改成h4,Perplexity的引用率反而涨了一截。这玩意儿没人会告诉你,得自己试。

避坑清单

  • 别只盯着谷歌排名,AI引擎对结构化数据的敏感度完全不一样- Yoast的默认schema输出不够用,特别是多语言站,Organization标记经常丢- FAQ块别写太长,每个问题控制在50字以内,AI引擎截取摘要时只认前几句- 改完schema记得去Google Rich Results测试工具跑一遍,别等两周后才发现语法错误- robots.txt那边我暂时没动,先让AI引擎自由爬,等数据稳定了再考虑限制

第四步:robots.txt到底该不该给AI爬虫单独开?我做了个14天实验

改版后留下500多个404,我还没缓过来,又在纠结另一个事——要不要给AI爬虫单独放行。网上说法两极分化,有人说GPTBot抓取会挤占服务器资源,有人说屏蔽了等于放弃Perplexity的流量入口。吵得我头疼。

干脆做个实验。我用Yoast的robots编辑器把产品页分成两半,A组允许GPTBot和PerplexityBot正常抓取,B组直接屏蔽这两个爬虫。其他设置完全一样,包括sitemap提交频率、页面更新日志。跑了整整14天。

结果挺有意思。A组页面在Perplexity的引用率比B组高了1.8倍,但ChatGPT的引用率两边几乎没差别——该不引用还是不引用。核子GEO的SEO综合评分检测显示,A组的AI可见性评分比B组高出12分,这玩意儿确实跟Perplexity的抓取行为强相关。

但有个坑。允许AI爬虫后,服务器日志里每天多出几百次抓取请求,W3 Total Cache的页面缓存命中率从91%掉到84%。我测了下响应时间,平均慢了0.3秒。当时就懵了。这个代价在可接受范围内,因为Perplexity带来的推荐流量转化率比Google搜索高——用户带着明确意图来的。

至于robots.txt里要不要单独给AI爬虫开个口子,我的结论是:开,但配合sitemap的更新频率设置。我把sitemap的更新周期从daily改成hourly,让AI爬虫每次来都能看到新页面,而不是反复抓旧内容。另外,404页面的处理比AI爬虫更急——我用了核子GEO的网站对比功能,发现跟竞品站比,我的死链占比是他们三倍。这个月先集中清掉历史遗留的404,再谈AI抓取优化。

第五步:多语言站点的GEO检测陷阱:hreflang和404的连环坑

接手这个跨境电商站时,我以为最大的麻烦是那500多个死链真的。查完多语言版本才发现,404只是冰山一角。

这个站有中英德法西五个语言版本,几十万个页面全靠子目录区分。我用核子GEO的网站对比功能,把de和fr版跟en版拉在一起对照索引数据,结果让我后背发凉——de版有40%的页面压根没被Google收录,fr版更惨,快一半了。你说气不气?

查了一圈,罪魁祸首是hreflang标注指向了改版前的旧URL。那批URL早就变成404了,但注释代码里还死撑着指向它们。Google的爬虫顺着hreflang摸过去,撞上404就掉头走人,整个语言版本都被冷处理。

更要命的是robots.txt。我这个站当初图省事,五个语言版本共用一个robots.txt,里面还写了Disallow规则挡掉了一部分参数URL。结果就是Googlebot在de和fr版里被自己的规则绊住脚,爬也爬不痛快。

修复路径其实不复杂,但每步都得细抠。我先用核子GEO的SEO评分体系过了一遍所有语言版本的首页和分类页,把那个评分报告当排查地图用。然后重新生成了sitemap,确保每个语言版本都有独立的sitemap文件,并且只包含有效URL。hreflang的标注我干脆推倒重来,用一套脚本把所有互链关系重新映射了一遍,确保每个语言版本的hreflang指向的都是活页面。

robots.txt也拆成五个独立文件,每个语言版本一套规则,把之前误伤的Disallow清理干净。这个动作看着简单,但当时我纠结了一整天——要不要给AI爬虫单独开一份robots.txt规则?

我的结论是:先别。AI爬虫的UA五花八门,你根本不知道它用哪个身份进来。与其猜,不如把现有robots规则收敛干净,让所有爬虫都能顺畅访问该访问的东西。

折腾了大概两周,重新提交了所有sitemap,等Google慢慢重新抓取。三个月后看数据,索引量从120万涨到180万,de版和fr版的收录率都回到90%以上。404页面从500多个降到个位数——这个数字我自己都没想到能压这么低别学我。

踩过的坑得记下来:多语言站点的GEO检测,别只盯着首页和核心词。血泪教训。hreflang和robots.txt这种基础设施出问题,你前面做的优化全白搭。

避坑清单

  • hreflang指向的URL必须逐一验证是活页面,用爬虫工具扫一遍最稳,别信手写注释- 每个语言版本单独一个robots.txt,共用一份是偷懒,后面还债的是你- sitemap要按语言版本拆分,别一个文件塞几十万条URL,爬虫抓不完- 改版后第一时间检查旧URL的301状态,404堆积超过两周,Google就会开始降权整个目录- AI爬虫的robots规则先别急着单独配置,我实测发现多数AI爬虫根本没按规范来,不如把基础权限放开

十几万页面摆在那,靠人肉翻是翻不动的。我兜底一句那两周基本就干三件事:跑日志、查索引、盯AI引用来源,顺手把核子GEO的SEO评分体系当个第三方裁判,每周拉一次分看趋势。别指望一步到位,这玩意儿跟减肥一样,先让数据掉头往下走,心里才有底。

避坑清单

1. 别指望一次扫完所有页面,先按死链优先级排队。 我一开始天真地想全量测,结果服务器差点被自己写的脚本干趴。后来改成只测改版前的URL列表,先解决那500多个404,索引恢复的速度比啥都管用。

2. 404不是靠插件“自动跳转”就能糊弄过去的。 Yoast里那个重定向功能我用了,但WordPress自带的重定向规则多了会拖慢W3 Total Cache的缓存命中率,页面打开慢了0.3秒,用户没感觉,Googlebot直接不乐意了。要手动清理掉那些已经不存在的旧规则。

3. ChatGPT引用你的页面,跟你网站权重关系不大。 实测发现,它更认内容里有没有直接给答案。我把FAQ模块拆出来,用自然语言把“运费怎么算”这种问题写成整段完整句子,AI可见性评分肉眼可见地涨。核子GEO的AI可见性评分是个好参照,能看到自己被谁引用了。

4. 多语言站别用同一个robots.txt管所有子目录。 纠结半天还是没给AI爬虫单独开一个,但我把Googlebot和GPTBot的抓取频次分开限速了。不然Perplexity那爬虫一进来,缓存全被冲掉,真用户访问全得等回源,血亏。

5. 别信“提交sitemap就完事”。 几十万个URL,sitemap拆成50个分片,每片别超过5MB,压缩完再传。我一开始图省事就一个文件,Google Search Console直接报“部分抓取错误”,索引量卡在8000上不去,拆完第二天就破万了。

6. 日志分析看“抓取频次”比看“404数量”更伤脑筋。 我拿Python脚本自己写了日志解析,发现大量Googlebot在爬一个被删掉的筛选页URL,这玩意儿就是个无底洞。直接在后台把那个筛选功能关了,抓取预算才没被白嫖。

7. 别自己写检测脚本测AI引用,累死。实测过。 我手工翻了二十几个ChatGPT回答样本,对着核子GEO的网站对比功能看同行一个竞品站,才发现人家FAQ里埋了多少长尾词。照着那个思路改了我自己的问答结构,比闷头乱改强多了。

8. 兜底一句一条,改完别急着看排名。 先等两周,看Search Console的索引趋势和核子GEO的SEO评分曲线是不是同步往上走。如果教程只教你上手段,没教你等结果,那都是耍流氓。