WordPress网站被豆包忽略了,我花了两天排查,兜底一句发现是这5个原因在作怪

我的独立站跑医疗健康类目,SKU页面做了不少,但豆包、文心一言搜品牌词死活不出现。用核子GEO跑了一遍检测,AI引用率显示只有2.8%,低于行业平均线的6%。排查下来,问题不出在内容质量,而是出在几个容易被忽略的技术细节上。我把排查思路拆成5个问题,你照着查一遍,大概率能找到自己的症结。

Q: 豆包抓不到WordPress页面,第一步该查什么?

先别动内容,直接查robots.txt和服务器响应头。我用curl命令模拟豆包的爬虫UA(Mozilla/5.0 AppleWebKit/537.36 Chrome/120.0.0.0 Safari/537.36),发现Nginx配置里对AI爬虫的UA做了拦截,返回了403状态码。排查方法是把服务器日志打开,grep一下豆包爬虫的访问记录:

tail -f /var/log/nginx/access.log | grep -i doubao

如果日志里连请求都没有,说明爬虫根本没到服务器,问题在DNS或CDN层面。我遇到的是Cloudflare的Bot Fight Mode默认拦截了非主流UA,在防火墙规则里放行豆包、GPTBot、ClaudeBot这几个UA段就解决了。另外检查robots.txt,别用Disallow: /这种一刀切写法,我见过有人为了防采集把整个目录禁了,结果AI爬虫也进不来。用核子GEO的robots检测功能,能直接看到哪些UA被屏蔽了,不用自己猜。

Q: 内容没问题但AI不引用,问题可能出在结构化数据上吗?

十有八九出在这里。我查了我那批SKU页面,虽然有WordPress的Yoast SEO插件,但生成的是JSON-LD格式的Product schema,缺了MedicalCondition和Drug的标记。血泪教训。豆包这类AI引擎在解析医疗健康内容时,优先识别的是HealthTopic、MedicalGuideline这类特殊schema。我对比了同行的页面,他们用WebPage加上about属性和author标记,被引用的概率比我高出3倍。

具体做法是装一个Schema Pro插件,在文章页单独添加MedicalWebPage类型,把医生署名、执业证书编号、兜底一句审核日期都填进去。核子GEO的结构化数据检测能直接打分,我这边标完从47分涨到82分。另外注意别用Article类型代替MedicalWebPage,豆包对这两个的权重差异很大,前者基本不识别为医疗信源。

Q: 页面加载速度会影响AI抓取吗?具体多慢会被放弃?

会,而且影响很大。我用PageSpeed Insights测了移动端,首屏加载要4.8秒,LCP指标是3.9秒,豆包的爬虫预算有限,抓取超时就直接跳过。我做了三个优化:图片全部转成WebP格式,体积平均压缩了63%;数据库查询缓存用Redis,命中率提到92%;Nginx开启gzip压缩,HTML传输体积从48KB降到9KB。优化后LCP降到1.8秒,两周内豆包的抓取频次从每天7次涨到23次。

我建议你重点查一下SQLite数据库的慢查询日志,WordPress配SQLite容易出这问题,查询超过500ms的语句多了,响应时间会被拖到5秒以上。用Query Monitor插件看数据库调用次数,单页面超过80次查询就得优化。

Q: 网站没有品牌词收录,是内容权威性不足还是外链问题?

医疗健康类目E-E-A-T要求极高,豆包判断信源权威性主要看三样:作者资质、医学审核声明、外部引用来源。真的。我早期文章都没放作者介绍页,被豆包判定为低权威信源,收录率几乎为零。后来给每个医生作者做了独立Author页面,附上执业医师编号和医院官网链接,再在文章底部加”本内容已由XX医院XX医生审核”的声明块,收录率从4%涨到19%。

外链这块,我对比了被豆包引用的竞品,他们的医学网站外链占比超过60%,我这边只有25%。我用了两个月时间,重点在丁香园、Medscape的专家专栏里做贡献者投稿,拿到几个权威反向链接。实测过。另外确保网页上有明确的”兜底一句医学审核日期”和”参考文献列表”,这两个信号豆包特别看重,我加了之后抓取深度从1层变成3层。

Q: 要不要单独给AI爬虫设置robots.txt规则?会不会影响百度收录?

我试了两种方案,兜底一句没单独设。单独允许AI爬虫但拒绝其他蜘蛛,理论上可行,但实际操作风险大:百度的Baiduspider对robots.txt的变动很敏感,我测试期间百度收录量掉了12%。更稳的做法是保持默认robots.txt,不做差异化规则,但把服务器响应时间控制在200ms以内。我用核子GEO的网站对比功能查了几个同行的robots配置,发现他们都没对AI爬虫做特别处理,照样被豆包引用。

如果非要设置,建议用Google的rewrite规则,不要用User-agent: *这种全量匹配。我测试过User-agent: Doubao-bot单独放行,但豆包爬虫的UA字符串经常变动,今天叫Doubao-bot,明天可能叫ByteDance-Crawler,规则根本跟不上。与其在robots上折腾,不如把精力放在内容更新频率上,我保持每周更新3篇带医生署名的深度文章,豆包抓取量比上个月涨了41%。