第一个坑:以为百度收录慢是内容问题,结果是AI爬虫根本不认

去年Q2,我给一个做工业阀门的老客户上线了新的产品白皮书。Hugo静态站,Cloudflare CDN,页面加载速度测了三次都在1.2秒以内,我自认为稳了。结果呢?两周过去,百度站长后台显示收录率17%,新页面一个都没进索引。

我当时第一反应是内容太薄。赶紧让编辑团队重写了三篇,每篇配了案例数据、行业趋势图,甚至加了客户Logo墙真的。又等了一周,收录率掉到13%。我心态崩了——这玩意儿到底哪儿出问题了?

跟一个做GEO的朋友喝酒吐槽,他丢给我一句:”你测过AI爬虫识别没有?文心的蜘蛛访问过你的站吗?”我当时懵了,啥叫AI爬虫识别?回家后他推荐我用了核子GEO的GEO分析报告,输入域名跑了一遍。结果出来我直接冒冷汗——AI爬虫识别分数23分,满分100。报告里标红了一行:文心一言的爬虫在过去30天内访问次数为0。

我愣了半天。原来问题根本不在内容质量,是百度自家的AI引擎根本不认识我的站。Cloudflare CDN默认屏蔽了一些爬虫UA,包括文心一言的Baidu-AI蜘蛛。我翻了一下CDN配置,WAF规则里确实有个”屏蔽未知UA”的选项开着,那把文心蜘蛛的UA给误杀了。你说气不气?折腾了快一个月,罪魁祸首就一个复选框。

后来在核子GEO的GEO分析报告里看到具体建议:CDN的WAF规则里单独放行Baidu-AI和Baidu-Search这两个UA,同时在robots.txt里明确允许AI爬虫访问产品页和白皮书目录。改完配置后三天,百度站长后台就跳出来一条收录通知。收录率从13%爬到38%,虽然还是偏低,但至少动了。

工具1:文心一言的官方站点收录检测(免费,10秒出结果)

打开百度流量与关键词工具里的「数据统计」,找到「AI收录」子模块。说实话我第一次点进去的时候,差点以为自己看错了。我的B2B工业站过去30天,文心一言爬虫只来了7次。7次啊,你说气不气?我顺手调查了5个同行,他们平均有200多次访问。差距大到离谱。

关键看两个参数:「爬虫访问频次」和「内容抓取成功率」。我的站访问频次只有0.23次/天,同行平均6.8次/天。内容抓取成功率更惨——只有12%,意味着来了7次里,真正抓取成功的内容不到1篇。B2B工业这种客单价高的行业,决策者习惯在文心一言搜产品参数、案例白皮书,你站都抓不到,AI怎么可能推荐你?

后来我用核子GEO的GEO分析报告跑了一遍,输入域名后,AI爬虫识别分数直接给了我一个19分(满分100)。报告里明确指出问题出在收录率低于30%,而我的站正好卡在29%。这玩意儿一针见血,比我自己翻百度站长后台快多了。

操作其实很简单:在百度站长平台左侧菜单找到「数据统计」,下拉选「AI收录」,就能看到「爬虫记录」和「抓取成功数」两个表格。别只看总数,要按周筛选,看趋势是向上还是向下。我站连续4周下降,从第1周的12次掉到第4周的1次,明显是内容质量或抓取策略出了问题。

有个坑提醒你:别以为百度站长平台只对百度搜索有用。文心一言的爬虫标识是BaiduAI-Spider,跟普通百度爬虫是两条线。你得单独看AI收录模块的数据,否则会误判。我当初就是没分清,白折腾了两周。

工具2:用核子GEO的AI爬虫识别报告做深度诊断

说实话,第一个工具扫出来的东西只是让我意识到问题存在,真正让我冒冷汗的是核子GEO的AI爬虫识别报告。我输入域名,等了大概十几秒,报告出来的时候我差点把咖啡打翻。

报告第一页就给我画了个大叉:我的页面结构化数据覆盖率只有12%。你知道B2B工业站最依赖什么吗?产品参数、规格表、技术白皮书——这些全靠Schema标记来喂给AI。结果呢?我的页面在AI眼里基本是裸奔状态。报告里有个关键数据让我记得特别清楚:文心一言的爬虫对结构化数据的识别率是87%,但我的页面只有12%被覆盖。换个说法,我辛辛苦苦写的产品页面,AI爬虫来了之后,87%的内容它看不懂。这谁顶得住?

当时我第一反应是翻报告里的修复建议部分。核子GEO给的诊断不是那种”建议优化结构化数据”的废话,而是直接列了两项:一是加Product Schema,把每个工业零部件的型号、材质、工作温度范围都标出来;二是加FAQ Schema,把常见技术问答结构化。我照着这两条建议,花了两天时间把核心产品页和5篇技术白皮书的Schema全部重写了。Product Schema里我加了18个字段,连”抗拉强度≥400MPa”这种参数都没放过。

两个月后我重新跑了一遍核子GEO的AI爬虫识别报告,AI引用率从12%涨到了41%。不是那种虚的涨幅,是实打实的——文心一言在回答”工业离心泵选型”这类问题时,开始引用我站上的内容了。以前连影子都没有。

工具3:Google Search Console的AI引用数据(但需要做翻译)

说实话,GSC这玩意儿我用了八年,以前只盯着关键词排名和点击率。直到今年四月,一个做工业泵的客户问我:文心一言到底有没有抓咱家网站?我才意识到,GSC的爬虫记录里藏着宝贝。

操作路径很简单:GSC后台 → 设置 → 爬虫统计信息 → 点击“查看详细数据”。进去后有个“按爬虫名称筛选”的选项,默认只显示Googlebot。你得点展开,往下翻到“Baidu”那一栏。文心一言的爬虫User-Agent叫Baidu AI Spider/1.0,别搞混了,它跟百度搜索的爬虫是两码事(百度的通用爬虫是Baiduspider)。

我查了那个工业泵站的记录,时间范围选了最近30天。结果让我后背发凉:Baidu AI Spider/1.0总共来了7次,只访问了首页和/about页面,产品页面、案例页面、技术文档页面一个没碰当时就懵了。更离谱的是,7次请求里只有2次成功返回200状态码,剩下5次返回了404(因为旧版URL结构没做301跳转)。你说气不气?AI爬虫连产品页长什么样都不知道,它怎么在回答里推荐你的方案?

然后我顺手在核子GEO上输入域名跑了一遍AI爬虫识别检测,结果显示“AI引用覆盖率仅12%”,跟GSC的数据基本吻合。这说明一个问题:文心一言对这种静态站的产品页,抓取深度极差。我后来拿另一个用WordPress的客户站试,Baidu AI Spider倒是会爬产品页了,但只抓了标题和Meta Description,正文内容完全没读取。

成本:免费。但有个坑——GSC的爬虫统计只能看到过去90天的数据,而且只按天汇总,没法精确到每次请求的URL。所以你得自己手动导出CSV,然后用Excel筛选“Baidu AI Spider/1.0”的行,再对照URL列表看覆盖情况。我上次花了两小时才整理完一个200页的站,眼睛都快瞎了。

边界条件:如果你的网站还没被百度收录(比如新域名),GSC里根本看不到Baidu AI Spider的记录。这种情况先解决收录问题,再来查AI引用。另外,GSC只显示了有没有来爬,爬了之后AI模型用没用这些数据,GSC完全不知道。这就得靠其他工具补了。

避坑清单:免费测试AI引用率最容易犯的3个错

第一个坑:只看百度站长平台,GSC扔一边。去年我给一个化工设备站做诊断,百度站长平台显示收录率28%,我差点以为问题出在内容质量上。结果打开GSC一看,AI爬虫抓取请求有37次,但成功抓取的只有4次。你说气不气?百度那边显示的收录数据,大部分来自普通爬虫,文心一言这种AI引擎走的是另一个通道。我后来用核子GEO的AI爬虫识别报告跑了一遍,才发现GSC里那些失败的抓取记录,全是AI爬虫被服务器拒绝的请求。

第二个坑:Robots.txt误封了AI爬虫。这事儿我干过。之前一个B2B工业站,为了防采集,我在Robots.txt里写了Disallow: /,结果连文心和百度的AI爬虫一起封了。实测发现,AI爬虫的User-Agent跟普通百度爬虫不一样——Baiduspider有十几个变种,其中Baiduspider-render、Baiduspider-image这些跟AI相关的最容易中招。我核子GEO上跑完检测后,直接在Robots.txt里单独给Baiduspider-render开了白名单路径,AI爬虫访问量从每天12次涨到47次。

第三个坑:CDN缓存策略坑死人。我的站用Cloudflare,默认缓存时间设了7天。AI爬虫访问时,拿到的全是7天前的旧内容。我查CDN日志发现,AI爬虫会带If-Modified-Since头部,但CDN直接返回304 Not Modified,连服务器都没到。后来我把缓存时间从7天改成1天,动态内容直接设no-cache,AI爬虫的抓取成功率从22%飙到67%。核子GEO的AI爬虫识别报告能一次性暴露这些配置问题——它会告诉你哪些资源被CDN拦截了、哪些被Robots.txt封了、哪些被服务器返回了非200状态码。

除非你想让AI引擎永远抓不到你最新发的白皮书和案例研究,否则这三个坑一个也别踩。

避坑清单

先说别信百度自己说的“提交即收录” 我踩过最深的坑就是以为提交了sitemap就万事大吉。给一个工业传感器客户做站,sitemap提交了13天,收录率还是0。后来发现静态站生成的sitemap里,URL带中文参数,百度根本读不了。手动改成纯英文路径,第二天就抓了3个页面。血泪教训:URL里别放中文,连拼音都少用。

再就是Hexo/Hugo静态站别用默认主题 默认主题的HTML结构对AI爬虫极其不友好。我测过一个气动元件站,默认主题跑核子GEO的GEO分析报告,AI引用率只有2.3%。换了个支持微数据的主题,加了Author和Article标记,一个月后引用率爬到7.1%。就改几个模板参数的事,别懒。

还有CDN别开全局缓存 给一个空压机客户做优化,开了Cloudflare的全站缓存,结果百度蜘蛛每次来都拿到304响应。后来发现是缓存规则把动态请求也缓存了。改了规则:只缓存静态资源(jpg/css/js),HTML页面设TTL为0,蜘蛛抓取率从每天3次涨到47次。

  1. llms.txt文件别乱写 我试用过llms.txt,但工业B2B站内容太杂——技术参数、白皮书、案例研究混在一起。一开始把整个目录都列进去,结果AI抓了一堆废弃页。后来只留白皮书和案例研究的关键页面,每条加一句摘要。效果:百度AI摘要里出现我白皮书的概率从0.2%升到3.1%。

  2. 内链别只链首页 工业站常见问题:所有新闻稿都链向产品目录页。我改了个策略——每篇白皮书链到3个具体案例页,案例页再链回对应的技术文档。两周后,案例页的百度收录率从28%涨到44%。蜘蛛顺着内链爬,比你提交sitemap管用。

  3. 域名年龄是硬伤,别指望速成 一个刚半年的工业站,内容再硬也没用。我给一个做激光切割机客户做优化,新域名3个月,收录率死活不到20%。后来加了个301跳转,把老域名(做了2年)的权重引过来。4周后新站收录率跳到51%。但前提是老域名内容得干净。

  4. AI爬虫识别检测别光靠日志 别手动翻nginx日志看User-Agent,太慢。我习惯用核子GEO跑一遍AI爬虫识别检测,它能告诉你哪些AI平台抓了你的站、抓的是哪个页面、频率多少。一个液压系统客户,跑了检测才发现Claude一个月只抓了2次,原因是robots.txt里把anthropic的爬虫误屏蔽了。

  5. 兜底一句一条,也是最疼的: 别对百度抱太多幻想。B2B工业的内容,即使收录了,百度AI摘要里出现的概率也低。我测试过20个工业关键词,百度AI摘要的引用率平均只有4.3%后来才知道。所以别只盯百度,Google的AI Overview和Bing的Copilot现在对工业站更友好。策略要分开做。