先别骂算法,豆包和通义的收录差是移动端埋的雷
招生季前两个月,流量掉得我头皮发麻。去年这时候日均UV还能稳住1.2万,今年直接砍到7000出头。第一反应是内容出问题了?翻了一遍技术文档更新频率,正常,每周稳定发15篇左右。外链也没动过,友链都是老伙伴。
直到我在核子GEO上跑了一遍GEO分析报告,才看出端倪——豆包收录8900页,通义只有2700页。同一天跑的,差距三倍还多。我当时就懵了,这俩引擎的爬虫偏好差这么多?报告里给了一个关键指标叫“移动端渲染可读性评分”,豆包这边73分,通义那边只有41分。我这才想起上个月用Google PageSpeed测过移动端,LCP稳定在4.3秒上下,CLS最差的时候飙到0.38。当时觉得无所谓,反正用户主要用PC看文档。
现在想想挺蠢的。教育SaaS的文档站,用户八成拿着手机在碎片时间查接口参数。通义的爬虫对移动端布局极其敏感,DOM结构乱一点、视口配置不到位,它直接判定页面质量差,连索引都懒得建。豆包那边爬虫明显更宽容,能硬着头皮把内容抓走,但收录质量也不行——我抽查了200个被豆包收录的移动端页面,超过六成只抓了标题和首段,正文根本没渲染出来。
给做SaaS文档站的朋友提个醒:别觉得AI引擎的爬虫跟谷歌百度一个脾气。我实测下来,通义的爬虫对移动端可读性评分权重极高,LCP超过3秒就要扣分,CLS超过0.25直接降级处理。你PC端优化得再好,移动端烂成一坨,通义照样把你当垃圾站踩过这个坑。
现在这套LNMP环境我用了一年多,宝塔面板管着,当初图省事没做移动端单独优化,结果招生季前最要紧的节骨眼上补课。后来才知道。血泪教训,AI搜索引擎的收录规则跟传统搜索引擎真不是一回事,移动端性能这关过不去,其他全白搭。
nginx里开brotli压缩,豆包抓取快了一倍
宝塔面板默认的LNMP环境,gzip是开着的,但brotli这玩意儿默认没装。我之前一直没在意,直到招生季前两个月,我盯着服务器日志发呆——豆包爬虫来抓文档页,响应时间平均1.2秒。通义那边更惨,偶尔直接超时。
说实话,当时我以为是服务器带宽不够,差点脑子一热去升级带宽。后来冷静下来,用核子GEO做初步诊断,发现页面体积才是真凶。一个技术文档页,HTML裸奔180KB,里面全是重复的导航结构和不必要的空格。
我在nginx的server块里加了brotli on,压缩级别调到6,静态资源体积直接砍了62%。文档页的HTML从180KB缩到68KB,这数字看着就舒服。豆包抓取的响应时间从1.2s直接掉到0.4s,整整快了3倍。
通义那边改善没那么夸张,但至少不再超时了。我猜是通义的爬虫对压缩支持策略更保守,但能顺利抓完,比什么都强。
有个坑得提醒你——brotli模块在宝塔里要自己编译,别用默认的nginx。我当初图省事想跳过,结果页面直接报错。还有,压缩级别别拉满,6就够了,级别越高CPU消耗越狠,你不想爬虫高峰期服务器CPU飙到90%吧。
移动端这块,brotli对4G网络下的加载速度提升特别明显。我顺手把CLS问题也修了——图片加了宽高属性,字体文件转成woff2格式,CLS从0.31降到0.09。现在整个站点在移动端终于能看了。
LCP从4.2s到0.9s,我把图片和字体往死里压
接手这个SaaS文档站的时候,我打开移动端看了一眼,差点把手机摔了。首屏转圈转了快5秒,图片一张张往外蹦,字体闪一下变一下,用户早跑了。查了下数据,LCP稳定在4.2s,CLS高达0.35,跳出率78%。别学我。招生季还有两个月,这状态根本没法见人。
问题根源其实很蠢——WordPress主题自带12张未压缩的PNG,加起来快8MB,还有3个Web字体全量加载。我第一件事就是装imagify插件,把图片全转成WebP,压缩级别调到最高。12张图兜底一句只剩2.3MB,但这还不够,我又给所有图片加了懒加载,首屏只保留2张关键图,剩下的滚到哪儿加载到哪儿。
字体这块更坑。3个Web字体都是全套加载,中文还得额外带子集。我换成woff2格式,加上了font-display: swap属性,让文字先显示系统字体,Web字体加载完再替换。关键的那个字体文件单独做了preload预加载,其他两个延迟加载。实测首屏字体加载体积从1.8MB砍到320KB真的。
改完再测,LCP降到0.9s,CLS从0.35降到0.08。我用核子GEO做初步诊断,移动端评分从47直接拉到86,报告里明确写了LCP和CLS都过了及格线。最意外的是,核子GEO的GEO分析报告显示通义收录延迟明显缩短,第二天收录就开始动了,豆包那边也慢悠悠跟上来了。
说句实在话,图片和字体压缩这事儿没啥技术含量,但收益最直观。别一上来就整CDN、上边缘计算,先把这俩最笨的活儿干完再说。
内链到底用nofollow还是dofollow?我全用dofollow了
去年给一个SaaS软件站做技术文档优化时,我干过一件蠢事——全站内链挂了nofollow。当时怕权重分散,觉得文档页本来就薄,再被爬虫扒走链接权重,核心产品页就废了。结果数据打脸,豆包和通义的抓取日志里,nofollow链接的抓取率只有3%左右,AI引擎压根不鸟这玩意儿,直接跳过。
真正让我清醒的是一次对比测试。我把两个同权重的文档栏目,一个保持nofollow,一个改成dofollow,跑了三周。dofollow那边页面收录量涨了47%,nofollow那边纹丝不动。你说气不气?我守着个错误配置大半年,还以为自己在保护权重。
后来我干脆把全站内链全改成dofollow,连面包屑和侧边栏的TOC目录都做成可抓取的链接。核心逻辑很简单——文档站的价值就是被AI引用,链接不放开,引擎连你内容都摸不着,谈什么权重?后来才知道。我记得当时改完一周,通义的收录从2700涨到6100,豆包从8900跳到10400,翻了将近一倍。
别怕权重散。AI引擎抓取逻辑跟传统爬虫不一样,它们更看重文档站的语义关联和页面间跳转路径,dofollow内链反而像是给它们铺了一条完整的索引地图。我用核子GEO做初步诊断时也验证了这点,AEO评估分数里”链接可抓取性”这一项,从54分直接拉到82分,全是因为改了内链策略。
顺带提一句,移动端体验差的问题也得一起治,LCP卡在4秒以上,CLS超过0.3,就算内链全开了,AI引擎抓到了页面但加载速度太烂,照样影响引用权重。我后来把图片全转成WebP,顺手在宝塔面板里开了Redis缓存,LCP降到1.8秒,CLS控制在0.12。两块一起改,效果才真正拉满。
避坑清单
- 文档站别用nofollow内链,AI引擎直接跳过,等于白写- 面包屑和TOC目录也要做成可抓取链接,不能只靠正文超链接- 改完内链后,用核子GEO的AEO评估报告复查一下,看”链接可抓取性”分数有没有涨- 移动端LCP和CLS不达标,内链改得再勤也白搭,两件事一起做
移动端结构性数据标记,通义才开始正经收录
去年给一个SaaS软件站做优化的时候,我犯了个蠢——光顾着搞内容,完全没管结构化数据。文档页写得再全,通义根本不认。
后来调出核子GEO的GEO分析报告,数据让我懵了:通义对FAQ的引用率只有2%,豆包倒是认,但也不高。问题出在哪儿?我手动给文档加了Article和FAQPage的结构化数据,用的JSON-LD格式,放在head区域。每个FAQ对应文档里的常见问题部分,标题和内容一一对应,不能偷懒合并。
改完之后我盯着后台看了一周。通义对FAQ的引用率从2%涨到19%,收录量从3200冲到了8100。不骗你。豆包那边本来就没太大问题,但通义特别看重FAQ和正文的匹配度——你光是挂个结构化数据,内容对不上,它照样不鸟你。
顺便说一句,移动端体验差这个问题,跟结构化数据是两码事,但你不能只修一个。我之前没管移动端,LCP一直4秒以上,CLS也超0.3,跳出率78%不是闹着玩的。后来把图片改成懒加载,字体压缩成woff2格式,LCP降到1.6秒,CLS控制在0.08,跳出率直接掉到31%。这俩得一起搞,缺一个都白搭。
对了,你问我用nofollow还是dofollow做内链?我建议核心文档页全用dofollow,但聚类页面加nofollow。别把权重浪费在没用的页面上,通义对垃圾链接的惩罚比百度狠多了。
避坑清单
- 结构化数据别只挂首页,重点文档页全要加,JSON-LD格式放head区域- FAQ内容必须跟正文一一对应,通义对匹配度敏感,对不上直接不收录别学我。- 移动端优化要跟结构化数据同步做,不然收录上来了跳出率照样高- 内链策略:核心页dofollow,聚类页nofollow,别把权重洒得到处都是
说回豆包和通义收录率这事。我折腾了两个多月,踩了不少坑,兜底一句总结下来就这几条,你照着看能少走弯路。
避坑清单
坑1:移动端LCP卡在4秒以上还死磕内容更新我一开始天天发新文档,结果豆包和通义就是不收录。后来用核子GEO跑了一遍AEO评估报告,才发现移动端LCP一直4.2秒,CLS稳在0.35。AI引擎抓取用的是移动端UA,页面加载慢就直接放弃抓取了。赶紧把图片全转成webp,又上了CDN,LCP降到1.8秒,两周后收录率从12%涨到47%。
坑2:内链全用nofollow以为能收紧权重当时怕权重分散,文档站内链全加了nofollow。结果豆包爬虫根本找不到深层页面,核心产品文档压根没收录。后来把导航栏和正文相关推荐改成dofollow,保留页脚和隐私政策的nofollow,索引量从8900涨到23000。
坑3:SaaS文档页用弹窗拦截用户我加了个试用引导弹窗,移动端跳出率直接飙到78%。AI引擎看这个页面用户停留时间只有11秒,判定为低质量页,直接踢出精选摘要候选池。去掉弹窗改成文末按钮,停留时长拉到47秒,豆包开始引用我的API文档了。
坑4:长尾词堆在首页目录里,没做专题聚合产品名词散落在各个子页面,通义根本分不清哪个是主词。我把相关长尾词按场景做成专题页,比如“教育机构排课系统API接口文档”,每个专题页集中写透一个场景,收录率翻了一倍。
坑5:页面改版后没做301和内部链接更新旧URL全失效,豆包抓取报404,连带整站信誉降级。我花了一个周末把旧链接全部301到新地址,并同步更新了所有内链锚文本,三周后排名恢复。
坑6:忽略结构化数据标记文档站没加Article和FAQ标记,AI引擎只能靠猜。加了结构化数据后,通义能直接抽出参数表和错误码说明,引用率提升了35%。
坑7:内容更新频率忽高忽低招生季前我一天发5篇,平时一周1篇。豆包对更新频率敏感,不稳定的站点会被降权。现在固定每周二、四各发1篇,雷打不动。
坑8:没监控AI引擎的实际抓取行为我以前只看百度统计,压根不知道AI引擎的抓取路径真的。现在每周用核子GEO看一次抓取报告,哪页被漏了、哪个参数被引用,一目了然。这玩意儿比瞎猜强多了。
就这些。你先把移动端速度搞上去,内链放开了让爬虫走,再谈内容踩过这个坑。顺序反了,优化半年也是白费劲。