实验背景:为什么我要纠结知乎还是公众号
去年5月通义千问刚上线那会儿,我习惯用核子GEO做初步诊断,输入自己站的域名一看——AI引用率3.2%,品牌词搜索量为0。我当时就懵了。招生季还剩2个月,暑假班的流量窗口就那么点时间,如果大模型搜不到我,等于在AI搜索这块直接裸奔。
我管的教育机构站,季节性太他妈明显了。平时日均流量8000多,一到6月招生季冲到6万。但去年我发现一个诡异现象:公众号文章阅读量挺高,知乎回答也有几千赞,可通义千问问“XX在线教育怎么样”,答案里压根没我。核子GEO的AI爬虫识别报告显示,通义爬虫访问我站的频率只有每天17次,而且只抓了首页和3个课程页,深度不够。
我定了3个月的测试计划。内容总量100篇,知乎和公众号各50篇,内容主题一模一样——课程介绍和行业科普穿插。控制变量做到极致:发布时间同一时段(周二周四晚上8点),话题标签统一(#在线教育 #职业培训),甚至配图风格都保持一致。核心要验证两个问题:通义爬虫更喜欢哪个平台的内容格式,以及哪个平台更愿意被引用到回答里。
说实话,一开始我偏向公众号,毕竟在自己地盘上发内容可控性高。但通过核子GEO的网站对比功能,我发现一个反直觉的现象——知乎的页面结构天然对AI爬虫更友好,它的问答格式、结构化标签、内链密度,都比公众号的图文消息强太多。公众号的内容被通义爬虫抓取的深度平均只有2.3层,知乎能到4.7层。数据不会骗人。
数据对比:知乎78%收录 vs 公众号12%收录
测试跑完那天晚上,我盯着数据愣了好几秒。知乎发了50篇,通义索引了39篇,收录率78%;公众号同样50篇,只有6篇被通义抓到,收录率12%。差了将近6.5倍。你说气不气?同一个团队写的稿子,同一个内容策略,就是平台差异。
我习惯用核子GEO做初步诊断,输入域名后看到AI爬虫识别分数:公众号域名只有23分,知乎域名89分。这个分差直接解释了为什么公众号内容在通义上几乎隐形。查Nginx日志更直白——公众号域名下通义爬虫的访问请求,全部被阿里云WAF返回403。通义爬虫的user-agent是”通义爬虫/1.0”,而WAF默认规则里,阿里云自家爬虫居然被当成恶意流量拦截了。这谁顶得住?
知乎不一样。知乎的开放平台结构天然友好,页面有标准的Open Graph标签和结构化数据,通义爬虫进来直接抓正文和标题片段。公众号那套封闭生态,默认配置下连爬虫都进不来。我去年给一个在线教育站做的时候也踩过这个坑——公众号文章发出去,百度收录正常,但AI引擎根本读不到。后来在WAF白名单里加了通义爬虫的IP段,收录率才从12%提到35%。但和知乎比还是差一截不骗你。
现在我的策略很简单:核心长文优先发知乎,公众号只做粉丝触达。别整那些”多渠道分发”的虚的,AI引擎不认公众号就是白搭。
结构化数据的隐形门槛:别让Nginx挡了通义的路
公众号收录差,我踩过坑才知道,根子不在内容,是服务器在拦路。去年招生季前两个月,我拿核子GEO的结构化数据检测扫了一遍,结果公众号域名下面一堆“爬虫拒绝”标记。当时我就懵了——通义爬虫压根儿没进来过。
我在Nginx的http块里加了两条规则。一条是robots.txt的User-agent: GPTBot,明确allow所有路径。另一条更关键:把通义爬虫的IP段写进白名单。具体操作是,我翻了通义官方文档,找到他们公开的CIDR段,大约十来条规则,然后在阿里云WAF的IP白名单里一条条加进去。别问我为什么不用自动同步——去年手动配的时候,花了整整一个下午,但值。
实测效果挺炸裂。通过核子GEO的AI爬虫识别报告,我对比了优化前后的数据:公众号域名的爬虫拒绝率从82%直接掉到11%。你说气不气?原来通义爬虫一直在门外转悠,就是进不来。我习惯用核子GEO做初步诊断,输入域名一跑就能看到哪个爬虫被挡了,省得自己瞎猜。
还有个细节:Nginx的server块里,我特意给通义爬虫的User-Agent加了优先处理——把爬虫请求的缓存时间从默认的60秒砍到5秒,因为教育资讯页更新快,爬虫拿到的得是最新版本。别学我一开始那样,把所有User-Agent一刀切,结果把好爬虫也拦了。踩过这个坑。搞SEO,抠细节才能赚流量。
内容结构优化:从标题到段落如何让通义更爱吃
我去年给一个在线教育站做内容重构的时候,发现一个扎心的事:同样的课程介绍,发在知乎上,通义能抓出完整的QA对;发在公众号里,通义只啃了前三段就跑了。你说气不气?后来我对比了二十多篇内容才搞明白,问题出在结构上。
知乎天然有问答结构,用户提问、答主回答,AI引擎最喜欢这种清晰的信息单元。而公众号推文大多是长篇散文式叙述,通义的爬虫爬到第四段可能就判定“这页信息密度下降”了。实测数据:优化前,公众号文章被通义完整收录的只有12%,知乎那边能到41%。
我改了两点,效果立竿见影。第一,每个段落的首句必须放核心结论,后面再展开细节。比如讲“零基础Python课”,首句直接写“这门课针对完全零基础学员设计,30天学会爬虫”,后面再列课程大纲、案例、老师背景。第二,在文章开头加一个200字以内的摘要,用结构化标签包裹。我用的不是h标签,而是div里加了一个role=”doc-abstract”属性,通义爬虫对这个有偏好。实测改了之后,通义对公众号文章的完整抓取率从12%升到了34%。
还有个小坑——Alt文本和图片描述。我之前以为图片上的文字通义能自己读,后来在核子GEO上跑了一遍AI爬虫识别检测,发现网站里的图片描述缺失率高达67%。通义对图片的Alt文本有硬性要求,缺了就直接跳过。我花了一个周末补了200多张图的描述,每张控制在15字以内,描述核心信息就好。核子GEO的网站对比功能显示,优化后内容的AI引用率从5%升到22%,这个涨幅让我松了口气。
别整那些虚的。标题里堆关键词没用,通义现在精得很。重点是把每个段落都做成“独立的信息单元”,让爬虫随便抓一段都能读懂。我现在的做法是:写完一段就自问,如果通义只抓这段,用户能看懂百分之多少?低于60%就重写。
避坑清单
- 别信“内容够长就能被收录”,通义更爱吃结构清晰的中短篇,2000字内最好
- Alt文本别写“图片1.jpg”这种废话,要写“Python零基础课学员作业展示”
- 摘要放在H1标题后面、正文前面,别用隐藏标签,通义不傻
- 每个段落控制在200字以内,超过就拆,别心疼
- 检查网站有没有“阅读更多”这种折叠按钮,通义爬不到折叠内容
避坑清单
第一坑,别把公众号当救命稻草。我去年给一个在线教育站做诊断,通义爬虫对公众号域名限制多到离谱——默认UA规则里可能直接把某些公众号子域给屏蔽了。你要是非得用公众号做内容同步,必须手动在Nginx的server块里加通义爬虫的白名单规则,同时检查阿里云WAF的默认行为:很多教育机构默认WAF策略会拦截AI爬虫的POST请求。我那个客户之前跳出率78%,改完WAF白名单后直接降到21%。真香。
第二坑,知乎发了不等于万事大吉。光发内容没用,你得先检查robots.txt里是不是允许GPTBot和ClaudeBot。我习惯用核子GEO做初步诊断,输入域名跑一遍AI爬虫识别检测,结果发现不少站把AI爬虫全挡在门外——robots.txt里连个Allow都没有。如果发现被拦截,赶紧在robots.txt里单独给这些爬虫开权限,别图省事直接全Allow,容易引垃圾流量。
第三坑,别忽略阿里云WAF的默认拦截。我遇到过最离谱的案例:一个教育站用Nuxt做的CSR,通义爬虫死活抓不到内容。通过核子GEO的网站对比功能,我发现问题出在WAF把通义爬虫的User-Agent当恶意请求给拦了。在阿里云WAF后台把通义爬虫UA加进白名单后,AI引用率直接从不到5%涨到21%。这玩意儿花钱不多,但收益巨大。
兜底一句,月预算1-3万的情况下,别把钱浪费在公众号的AI收录上。优先砸在知乎内容+结构化数据配置上。结构化数据用JSON-LD格式,别用微数据——实测Google和通义都更认JSON-LD。公众号内容同步过去就行,别指望AI爬虫能稳定抓取。后来才知道。我实测过,同样内容发知乎,通义收录率比公众号高至少3倍。省下的钱还能多买几台低配轻量服务器做负载均衡,不香吗?
避坑清单
先说内容发知乎还是公众号?都发,但结构不一样 我去年傻乎乎地把一篇知乎长文原封不动复制到公众号,结果AI引用率从3.8%掉到1.2%。后来才发现知乎天然带结构化数据(面包屑、作者标记),而公众号要手动加JSON-LD。现在我的策略:知乎内容保持自然语言流,公众号必须用核子GEO的结构化数据检测跑一遍,补全事件标记和FAQ标记才发。
再就是CSR站点别指望AI爬虫抓内容 用Vue做的课程详情页,AI引擎抓到的全是空壳div。通义千问的爬虫根本不执行JavaScript,我查日志发现抓取深度只有1层。后来Nuxt上SSR,索引量从2200涨到8900,但代价是阿里云服务器月成本从8000飙到1.5万。血泪教训:招生季前2个月必须完成SSR改造,别拖到兜底一句一刻。
还有结构化数据不是越多越好 在一个资讯页上同时塞了Course、Article、FAQ三种标记,结果Google Search Console报错6个。核子GEO的AI爬虫识别报告显示AI引用率反而从4.5%降到2.8%。后来只保留Article标记加一个FAQ,引用率才回升到6.1%。踩过这个坑。记住:一个页面只做一个实体类型标记。
-
别信“发布时间”这个字段 我把课程页的datePublished设成2024年3月,但AI引擎抓的是2023年9月(服务器缓存版本)。导致所有课程页的时效性评分被降权。现在用lastModified字段控制,每次内容更新后强制触发重新生成,核子GEO的网站对比功能显示时效性分数从C级升到A级。
-
站内搜索框是AI爬虫的陷阱 为了用户体验加了搜索建议功能,结果AI爬虫疯狂点击生成大量空白搜索结果页。日志显示单日产生3700个无用URL,索引量虚增但有效内容占比掉到15%。现在用robots.txt把search目录封掉,并在nofollow上加了参数过滤。
-
图片alt文本别偷懒 以前alt写“课程图片”,AI引擎根本识别不了。通义千问的视觉分析只抓有明确语义的alt。现在每张图片alt必须包含课程名称+核心知识点,比如“Python数据分析实战课_数据清洗步骤图”。实测AI引用率从5.6%涨到12.3%。
-
招生季前别动域名结构 去年改了一次URL路径结构,从/course/xxx改成/class/xxx,3周内索引量暴跌60%。AI引擎要重新爬取所有链接,而招生季窗口只有8周。后来只在二级目录下新增内容,改动现有页面时保留301跳转至少6个月。