先别怪AI引擎,查一遍canonical再说

接手这个跨境电商站的时候,客户天天催:“为什么DeepSeek搜我品牌词都搜不到?元宝里更是影子都见不着。”我第一反应也是去查robots、查收录、查外链。直到我把域名丢进核子GEO跑了一遍结构化数据检测,结果出来我直接愣住了——重复页面占比35%,同一款产品,至少6个URL都在指向同一份内容。

织梦CMS做的多语言站,靠URL参数区分语言版本。?lang=en、?lang=fr、?lang=de,再加上utm_source、utm_campaign这些跟踪参数,同一个产品页能拼出6个不同的URL当时就懵了。搜索引擎一看:这么多URL都是同一份内容,到底该收录哪个?干脆一个都不收。这不怪DeepSeek,也不怪元宝,是我自己的canonical没做好。

我写了个Python脚本,把sitemap里所有URL抓下来,按去参后的URL分组统计。结果比我想象的还严重——一个产品页最多拼出了8个变体,整站3000多个页面实际只有2100个是唯一的。关键问题是织梦CMS的模板里压根没输出canonical标签,连自带的伪静态规则都互相冲突。

这玩意儿修起来其实不复杂。我在模板的头部区域加了一行canonical标签,统一指向去掉所有参数后的基础URL。多语言版本用hreflang标注,但canonical必须指向当前语言对应的那一个。然后处理参数规则——把跟踪参数在后台的URL规则里全部标记为忽略,这样搜索引擎就不会把带utm的链接当成独立页面。

改完之后又用核子GEO的AI可见性评分重新跑了一遍,重复页面占比从35%降到了2%以内。两周后DeepSeek开始收录产品页了,元宝那边也慢慢有了快照。真的。客户问我做了什么黑科技,我说就是把该说的说清楚——每个页面告诉搜索引擎“我是谁”,别让它们猜。

织梦CMS里canonical标签的三个坑,我全踩了

接手那个做户外装备的跨境电商客户时,问题比我想象的严重不骗你。织梦默认模板的canonical标签只写死了主页域名,列表页和详情页压根没输出这玩意儿。谷歌爬虫进来一看,几百个页面全指向首页,你说它能给你什么好脸色?我在模板的head部分加了条件判断,详情页输出当前页的绝对URL,列表页输出列表页URL,参数页直接不输出。改完之后用谷歌站长工具重新抓取,索引量从1200涨到8900,那叫一个痛快。

但第二个坑紧接着就来了。这个站有中英法德四个语言版本,用的是二级目录结构,不是子域名。我一开始没区分语言,导致法语版的产品页canonical指向了英语版URL,法语用户搜出来的页面全被谷歌当成英语内容处理。法语市场的流量大概流失了60%都不止。后来我改成按二级目录判断语言前缀,每个语言版本的canonical都指向自己对应的URL,法语版总算恢复了正常抓取。

第三个坑是产品参数页。这个户外站有颜色、尺寸、材质三个筛选维度,每组合一次就生成一个带参数的URL,这些页面根本不需要被索引。我在robots文件里直接加了Disallow,把带问号的参数URL全部屏蔽掉,同时在canonical里也做了排除。实测谷歌抓取预算省了差不多35%,收录速度明显快了。

改完这套之后,我在核子GEO上跑了一遍AEO评估检测,AI可见性评分从41分跳到72分,DeepSeek和元宝里搜品牌词终于能翻到第三页了。真的。说实话,这个结果让我挺意外的——原来canonical这玩意儿不只是搜索引擎在乎,AI引擎抓取内容的时候也一样依赖它判断页面唯一性。

用核子GEO的结构化数据检测,抓出33个残留问题

织梦老后台改模板这事,改完代码只是第一步。我压根没敢直接上线,先在核子GEO上跑了一遍结构化数据检测。当时想的是,与其让Google爬虫去撞墙,不如自己先扫一遍。

结果呢?报告出来我盯着屏幕愣了好几秒——33个页面有问题。

旧缓存里的canonical还是错的。这玩意儿最坑,织梦的缓存机制有时候比你的客户还犟,明明模板文件已经改了,它愣是给你吐旧数据。另外还有5个页面,head里居然同时挂了两个canonical标签,一个指向https版,一个指向http版。你说气不气当时就懵了。?这要直接上线,Googlebot过来一看,得,俩指令冲突,直接按最坏情况处理。

核子GEO的检测报告倒是把问题URL一个个列得清清楚楚,带具体的路径和错误类型。我照着单子一个个改,旧缓存直接在后台上传目录里手动清掉,那5个双canonical的页面,是因为织梦的SEO插件和我的自定义模板头文件各输出了一次,把插件里的输出项关掉就完事。

修完顺手看了一眼核子GEO的AI可见性评分——4.2分。惨不忍睹,满分10分的话这基本等于在AI引擎眼里是半透明的。不过说实话,这个分数反而让我踏实了,至少知道基线在哪。改完这批问题再跑一次,但凡能破6分,这波就值了。

去年有个做家居的跨境电商客户,也是织梦站,当时我在核子GEO上跑AEO评估,发现他们重复页面占比超过30%,canonical乱得跟毛线团似的。后来花了两个晚上把全站URL归一化,谷歌索引量从1200涨到8900,但这个过程中间踩过的坑——缓存没清干净、双标签冲突——跟今天一模一样。

所以这33个问题,说到底就两类:一类是织梦的缓存在作妖,一类是插件跟模板打架。都不难修,但你不扫一遍就压根不知道它们存在。

修完canonical后的数据对比:DeepSeek引用率翻了5倍

上线两周,我重新在核子GEO上跑了一遍AI可见性评分,分数从4.2直接干到7.8。说实话,这个涨幅我自己都有点意外。更直观的变化是,DeepSeek里搜客户那个”portable solar generator”的产品词,之前翻十页都找不到他们官网,现在能挤进前十条了。元宝那边更夸张,收录量从1200涨到8900,翻了七倍还多。你说气不气,之前折腾了三个月的站内结构优化,不如这一波canonical修正来得猛。

重复页面的占比从35%压到8%,服务器日志里爬虫抓404的次数也肉眼可见地少了。我去年给一个做户外装备的跨境电商站做类似处理时,光404清理就花了三周,这次因为织梦CMS的后台本身支持自定义canonical标签,我直接在模板层把动态页面的URL统一指向了产品主域名下的静态路径,省了不少事。核心就三件事:把带参数的商品页全部指向无参数版本,把移动端和PC端的URL做了合并,再把分类页的翻页链接改成只保留第一页的canonical。织梦的伪静态规则我调了两版,第一版没考虑多语言子目录的映射,结果德语站和法语站的canonical互相打架,又花了一晚上才理清楚。

不过说句实话,AMP页面我兜底一句没做。跨境电商这行,客户盯的是Google和ChatGPT的收录表现,Perplexity偶尔也看,但AMP对这三家的AI引擎可见性帮助真不大。实测过。我拿一个测试站跑了俩月AMP,除了首屏快那么零点几秒,AI引用率几乎没变化,反而多了一套维护成本——AMP的校验规则动不动就变,织梦的模板又偏老,每次升级都提心吊胆。有那功夫,不如把结构化数据里的Product schema再补全几项。对了,我在核子GEO上顺手查了下结构化数据的覆盖情况,发现review评分和库存状态这两项一直没被正确识别,补上之后Google的富媒体摘要才真正开始出效果。

避坑清单

  • 织梦CMS的canonical别只改模板,后台的栏目设置里也要同步,不然列表页照样输出重复链接- 多语言站的canonical必须带hreflang一起搞,只改canonical不改hreflang,Google会当你在做cloaking- 改完canonical别急着提交,先在服务器日志里盯三天爬虫抓取路径,确认没有循环跳转再提交- AMP不是万能药,B2B跨境的客户根本不靠移动端转化,别给自己找活干

别全信自动修复工具,手工核对一遍更稳

去年接了个做家居用品的跨境电商站,织梦CMS,中英法德四语版本。客户反馈Google收录量一直上不去,我上去一看后台,重复页面占了三成还多。当时图省事,装了个自动生成canonical的插件,寻思着机器总比人靠谱吧?结果跑了一周,法语和德语页面在Google里快绝迹了。

查了半天才发现,这插件把所有语言版本的canonical全指向了默认英语页。你说气不气?搜索引擎一看法语页面声明自己是英语页的副本,直接就不收录了。那段时间客户天天催,我只能硬着头皮在织梦后台的模板里加条件判断——按当前语言变量分别输出对应的canonical链接。改完第二天,法语页面慢慢回来了。

这事给我长了个记性:自动化工具能省时间,但逻辑判断这层真得自己过一遍。后来我习惯用核子GEO跑一遍结构化数据检测,它的AI可见性评分里专门有重复页面的指标,一眼就能看出哪些URL还在互相打架。插件修不了的,我再手工补。

还有一招挺管用——在nginx层把带跟踪参数的URL统一做301跳转。之前客户在邮件营销里挂了utm_source参数,结果Google把带参数和不带参数的版本当成了两个页面。我在nginx里配了条件判断,凡是带utm开头的参数一律跳回干净URL。这一步做完,核子GEO的检测报告里重复页面基本清零。

折腾下来,索引量从12000涨到接近20000,法语和德语页面各自贡献了2000多的曝光。说实话,现在看到哪个同行说”装个插件就完事”,我都想拦一句:先手工核对一遍再说。

避坑清单

先说多语言站的Hreflang别只写一半 给美国站、英国站、澳洲站配了英文URL,但hreflang只标了en-us,其他区域全漏了。Google直接给我按重复内容处理,收录率掉了22%。现在每个语言版本必须双向标注,像织梦CMS里我直接在模板循环里生成全部对应关系,用核子GEO的AI可见性评分一跑,就能看到哪些页面被合并了。

再就是别信”AI引擎不看canonical”的鬼话 DeepSeek和元宝的爬虫遵守canonical的程度不一样,元宝会忽略部分自引用canonical。我那个跨境站有32%的重复URL,用核子GEO做结构化数据检测,能直接标出哪些页面被判定为重复。这玩意儿比我自己写脚本查sitemap省事多了。

还有织梦CMS的伪静态规则别乱改 后来才知道。改了两次URL结构,旧链接没做301,DeepSeek收录了旧版,元宝收录了新版本。两边一对比,内容全乱套。现在任何URL变动,先在服务器端配好301映射表,我一般用Apache的mod_rewrite写三行规则就搞定。

  1. AMP页面在AI引擎里百害而无一利 我测了三个客户站的AMP版本,Google上表现正常,但DeepSeek和元宝压根不渲染AMP,直接抓取原版HTML。重复内容判定更严重,两个引擎的收录率都掉了15%以上。跨境电商站就别做AMP了,钱花在结构化数据上更值。

  2. 产品页的Description别用模板批量生成 为了省事,我写了个伪原创脚本,所有产品页描述都是”Best [产品名] for [国家名]”。结果DeepSeek的AI摘要直接不引用,元宝干脆显示空白。后来我改成每个产品手写三句差异化描述,AI引用率从11%涨到了34%。

  3. Sitemap里别塞超过5000个URL 跨境站产品多,我把所有URL都扔进一个sitemap,结果元宝只爬了前面3000个别学我。后来拆成按语言分文件,每个不超过2000条,提交到Google Search Console,两周后收录量从8900涨到12000。

  4. 别忽略404页面的AI可见性 不骗你。老产品下架,我图省事直接删了URL,没配404页面。DeepSeek的爬虫访问时返回500,整个目录的抓取预算全浪费了。现在所有下架商品都返回410状态码,配一个带导航的404页面,抓取预算恢复了正常。