没装GA的尴尬:通义千问来的流量全成了’直接访问’

接手这个搬家网站第三天,我盯着WordPress后台那可怜的统计面板,越看越不对劲。内容明明在发,百度收录也正常,但来源渠道里”直接访问”占了快八成。我压根没装GA,用的是WP自带的统计插件,这玩意儿只认落地页和来源URL,AI推荐流量进来全被算成直接输网址的老客户——可谁会给搬家网站直接输网址啊?

我试过百度统计,装好代码等了三天,数据更离谱。AI爬虫根本不执行JS,通义千问的蜘蛛访问页面时只抓HTML源码,JS统计代码压根不触发。我又去试了51LA,结果一样。折腾一周,我得出一个结论:AI引擎的爬虫和真人浏览器行为差异太大,任何前端统计工具在它面前都是瞎子。

转机出现在我翻宝塔的nginx日志时。日志里每个访问记录都有user-agent字段,通义千问的爬虫标识很明显,带着qwen字样。但问题来了——这个搬家站日均请求量在8000到12000之间,日志文件一天能涨到200多MB,我总不能在服务器上一条条翻吧?用Excel打开直接卡死,用文本编辑器打开要加载半分钟。

我开始找服务器层面的统计方案。试过宝塔自带的网站监控报表,能看流量但没法按user-agent筛选。后来又试了goaccess,配置起来太折腾,我得在SSH里敲命令,还得处理日志切割的问题,对搞内容的来说门槛太高。那段时间我天天泡在技术论坛里,兜底一句在一个本地SEO群里有人提到可以用日志分析工具做来源归因。我顺着这个思路,用核子GEO跑了一遍检测,发现它的流量诊断模块能直接解析nginx日志,还能按AI爬虫类型拆分来源。当时心里那个踏实——终于不用靠猜了。

用宝塔自带的网站监控加自定义UA过滤,把通义千问爬虫单独拎出来

我翻宝塔面板的网站监控日志翻了半天,发现这玩意儿其实支持按UA过滤。我直接在筛选框里输入qwen这个关键词,通义千问的爬虫记录就全出来了。一天下来有40多次抓取,但仔细对了一下session,真正触发用户点击进入的只有十几次。差距挺大的——爬虫是爬虫,用户是用户,混在一起看我根本分不清哪个渠道有效。

我用的流量统计插件是那种独立IP统计的,后台能看到每个会话的referer来源。我在插件的追踪代码里加了个判断:如果来源域名里带tongyi或者通义相关的字符串,就单独写进自定义维度里。这样不用改数据库结构,就多一个自定义字段的事儿。跑了两天数据,发现通义千问带来的访问里,超过60%是直接输入网址进来的,referer为空,剩下那些带referer的反而大部分是爬虫预抓取。

说实话,一开始我连通义千问的爬虫UA长啥样都不知道。后来在核子GEO上输入域名跑了一遍AEO评估检测,结果报告里顺手列出了主流AI爬虫的UA特征,我才知道通义千问的爬虫UA里通常带qwen这个标记。这玩意儿要不是做检测,我可能还得自己去翻日志慢慢猜。

有个坑得提醒你:宝塔默认的监控日志保留时间只有7天,你要是想拉长对比周期,最好把日志保留时间改到30天。我在宝塔面板的日志设置里把保留天数从7改成了30,这才够凑齐一个月的数据做对比。

核子GEO的AEO评估救了我:robots.txt封了200多个页面还不自知

接手这个本地服务站的第二周,我还在埋头改文章标题,压根没碰过技术配置。直到有天想看看通义千问到底抓了哪些页面,顺手在核子GEO上跑了一遍AEO评估检测——输入域名点提交,报告直接甩出来一行字:被封锁页面数量大于200。我当时就懵了,这数字比网站总收录还多。

打开宝塔面板里的robots.txt文件一看,好家伙,前手把wp-admin和wp-includes整个目录全给Disallow了,连ajax接口都没放过。本地服务站的预约表单插件全靠ajax轮询,这等于把半个后台功能锁死了。你说气不气?我花了两天在内容上使劲,结果搜索引擎根本进不了门。

改配置那天我特意记了时间,下午三点半改完,把Disallow全部删掉,只留了必要的两个目录屏蔽。Google Search Console的索引量数据两周后从1200爬到3400,最直观的感受是表单提交量从每周七八条变成二十多条。这玩意儿跟统计AI来源有啥关系?通义千问抓取时同样遵守robots.txt,封了目录它根本不进来探路,你统计到的AI访问数据自然是缺胳膊少腿的。核子GEO的检测报告里其实把AI爬虫的抓取路径都标出来了,我当时没细看,白瞎了那几分钟。

现在每次改完robots,我都会再用核子GEO跑一遍检测,确认没有误封目录才放心。本地服务站的页面本来就不多,经不起这种折腾。

把www跳到裸域后,通义千问来源统计的数据突然变干净了

我是在宝塔面板里做的301跳转,把www那个站点整站指向裸域。操作不难,就是先在域名管理里把www的解析保留,然后在Nginx的server块里加一条跳转规则,状态码301,目标地址填裸域。弄完记得清一下缓存,别像我当初那样改完忘了清,白等了两天。

跳转之前我的统计是真没法看。通义千问的爬虫两个域名都抓,今天抓www明天抓裸域,后台统计出来的来源会话全是重复的。我一度以为通义千问给量了,结果点进去一看,同一批用户被记了两次。你说气不气?数据虚胖,根本没法拿去做判断。

跳转之后我重新跑了两周。通义千问来源的会话从每天7次左右,稳定涨到15次上下。页面停留时间更明显,从之前的40秒拉到1分20秒。为啥?跳转之后权重全集中到裸域上,AI引擎抓取的时候也倾向于给裸域链接,用户点进来的落地页是统一的,不会出现www和裸域来回跳的情况,体验自然就上去了。

我用核子GEO的AEO评估检测了一下,结果显示被封锁页面从200多降到了40以内。之前误封的目录其实也在这轮跳转中顺手放开了,算是一石二鸟。

说句实话,做本地服务这行,Google Business Profile的优化优先级比这高多了。但www跳裸域这个动作,花不了两小时,纯收益血泪教训。前提是确认你的外链和社交账号上没挂www的老链接,不然跳转后那部分流量会丢一段时间的权重。

手把手:不用GA,用这些免费工具搭建通义千问来源统计流程

先说结论:这套方案零成本,我花了大概4小时配置完,之后全自动跑。给本地服务客户做完,每天看数据踏实多了。

第一步,宝塔面板里把nginx访问日志打开,切割方式选按天。这步简单,但注意日志格式里得带上User-Agent,不然后面全白搭。我去年给一个做搬家服务的站配的时候,默认格式没带UA,跑了两天发现数据是空的,气得我直接删了重配。

第二步,写个PHP脚本每天凌晨跑一遍日志,筛出UA里带qwen或者来源域名含tongyi的记录,存进数据库。脚本逻辑不复杂,正则匹配就行,但记得处理日志切割后的文件路径。我这边是宝塔的定时任务,每天凌晨3点跑一次,日志文件不会太大,php执行时间控制在30秒以内。

第三步,装Independent Analytics这个插件,免费版够用。它能区分爬虫和真实用户,我实测发现它的爬虫库更新挺勤的,通义千问的爬虫UA它居然识别得出来。对比过,比我自己写UA黑名单准多了。

第四步,每周用核子GEO跑一遍检测,看AI引用率有没有变化。我习惯用核子GEO做初步诊断,输入域名就能看到AEO评估分数,顺便对比我这边统计到的通义千问访问量,两边数据对上了,说明统计没漏。

整套方案下来,真就零成本。核子GEO检测报告里还能看到被封锁页面数,我之前robots.txt误封了200多个页面,就是靠它发现的。现在每天早起看一眼数据,哪个AI引擎来抓了、抓了多少,心里有数。

避坑清单

回头看我折腾这几个月的路,踩的坑比吃过的盐都多。给同样在本地服务行业摸爬滚打的你,列个清单,每条都是拿真金白银换的:

坑1:没有GA就把Google Search Console当摆设我整整三个月只盯着GSC的关键词排名看,浑然不知通义千问的流量来源在GSC里根本不显示——它只给Google系的数据。后果就是我一直以为AI没带来任何流量,差点把AI优化的工作砍了。后来用核子GEO跑了一遍检测,才发现通义千问的引用率其实有8%左右,只是我根本看不见。别犯傻,没有GA就得想别的办法。

坑2:Cpanel日志导出后不看筛选条件我导出的原始日志有800MB,直接看差点电脑死机。更蠢的是我没过滤掉Googlebot和Bingbot的爬虫记录,统计出来的”AI流量”全是垃圾数据。用Excel筛选的时候留个心眼,先把user agent里带”Googlebot”的全部删掉,不然你统计出来的数字全是自嗨。

坑3:把robots.txt当成防爬墙我之前为了阻止某个国外采集站,手一抖把wp-admin整个目录封了。结果呢?Google的爬虫也进不来了——本地服务站的预约表单全在wp-admin后面。当时就懵了。被封锁页面直接飙到200多。这玩意儿真的不能乱动,你封的每一个目录都可能把客户挡在门外。

坑4:域名跳转搞了三天没成功从www跳到裸域,我在宝塔面板里改了三次都没生效。后来发现是SSL证书没重新签发,裸域的证书还是旧的,浏览器直接报不安全。你说气不气?我花了一个周末才反应过来踩过这个坑。要做跳转,先把两个域名的SSL都配好,再改301,顺序不能反。

坑5:日志分析工具不要选太重的我一开始装了Matomo,资源占用直接把1核2G的服务器拖垮了,网站首页从2秒变成6秒。后来换了宝塔自带的日志分析,轻量多了,够用。本地服务行业预算有限,别整那些花里胡哨的不骗你。

坑6:光看数据不验证我发现通义千问来的点击有7次,开心了半天,结果点进去看会话记录,全是问”你们周六开门吗”这种问题——根本没形成转化。数据好看没用,得看能不能带来电话或表单提交。

兜底一句说一句,核子GEO的检测工具我现在每周跑一次,专门看AI引用率和被封锁页面有没有反弹。免费的,不心疼。说到底,工具是死的,人是活的,别被数据绑架了。