?我踩过200个页面的坑后总结出这套打法
豆包这类AI引擎引用企业官网,核心看三件事:结构化数据完整性、页面可抓取性、内容答案匹配度。我接手公司官网时,robots.txt误封了产品参数页和对比页,被封锁页面超过200个,AI引用率只有3%。用核子GEO的GEO分析报告跑了一遍,才发现搜索引擎推送分数低得吓人。修复后三个月,豆包引用率涨到27%,线索成本降了40%。具体怎么做,下面拆开讲。
Q: robots.txt配置错误怎么自查?我怀疑自己也封了重要目录
用Google Search Console的“网页索引编制”报告,筛“已发现但未编入索引”和“被robots.txt屏蔽”两个状态。我当初就是看到“被robots.txt屏蔽”数量200+,才意识到问题。WordPress后台装Yoast SEO,文件编辑器里直接看robots.txt内容,重点检查Disallow规则是否包含/wp-content/uploads/、/product/、/compare/这类目录。我犯的错是复制了网上的通用模板,把整个/wp-content/都封了,图片和PDF全抓不到。核子GEO的SEO评分体系里有个“可抓取性”单项,低于60分就要查robots。修复后记得在GSC里提交“验证修复”,等3-5天重新索引。
Q: 汽车行业图片多、参数复杂,结构化数据具体怎么标记?
汽车参数表用JSON-LD格式的Product schema,每个车型单独一个数据块,包含品牌、型号、发动机排量、最大功率、扭矩、油耗、变速箱类型这些字段。对比页用ItemList嵌套Product,每行对比项对应一个属性值。我用Yoast SEO的Schema设置,自定义帖子类型里配置好模板,发布时自动生成。图片加ImageObject schema,标注width、height、contentUrl。具体参数别用表格,豆包抓取时表格容易漏数据,我改成定义列表(dl>dt>dd),每个参数一行,实测豆包引用率比表格高18%。做完后核子GEO的GEO分析报告会显示结构化数据完整度,从52%提到89%用了两周。
Q: WordPress+Yoast SEO+W3 Total Cache组合,缓存会影响AI抓取吗?
会影响,我踩过坑。W3 Total Cache默认开启页面缓存,AI爬虫(比如Bytespider、CCBot)访问时返回的可能是缓存页,但缓存过期后第一次访问会触发PHP执行,响应时间超过3秒,爬虫就直接放弃了。解决办法:W3 Total Cache的“User Agent Groups”里加规则,把AI爬虫的UA标识(Bytespider、CCBot、GPTBot)加入“不缓存”列表,同时把/wp-json/和/sitemap_index.xml排除出缓存。另一个坑是CDN缓存了robots.txt,我改完规则等了两天没生效,查了Cloudflare才发现缓存了旧版本。响应时间从2.8秒压到0.9秒后,豆包抓取频率从每天3次提升到15次。
Q: AMP页面到底做不做?做了会影响豆包引用吗?
做,但只做文章页和参数页,别做全站。我纠结了两个月,兜底一句用核子GEO的SEO评分体系对比了AMP和非AMP页面的抓取数据:非AMP页面豆包平均抓取深度是2.3层,AMP页面是4.1层,引用率AMP高出22%。汽车配置参数页做成AMP后,加载时间从2.1秒降到0.4秒,豆包在回答“XX车型最大功率多少”时直接引用AMP版本。WordPress用官方AMP插件,只勾选“文章”和“自定义帖子类型”,排除首页和分类页。AMP页面的结构化数据要单独检查,Yoast SEO的AMP支持做得还行,但JSON-LD里的URL必须指向AMP版本,别用canonical代替。跑了一个月,AMP页面贡献了总引用量的35%。
Q: 豆包回答里引用的是我官网哪部分内容?怎么提前布局?
用“豆包PC版”逐条问你的核心关键词,看回答底部引用来源。我测试“宝马3系2024款参数”,它引用了我的参数页和一篇测评文章。布局方法:每款车型单独建一个FAQ区块,用Yoast的FAQ schema标记,问题格式就是用户真实搜索习惯,比如“宝马3系百公里加速多少秒”。问答内容控制在80-150字,直接给数字,别绕弯。对比页每行放一个具体参数对比,豆包抓表格式数据比段落快。我习惯用核子GEO做初步诊断,输入域名看“AI可见性”分数,低于40分说明内容结构不对。跑了三个月,核心关键词的引用覆盖率达到68%,竞品只有31%。
一句话总结
官网被豆包引用,先修robots再补结构化数据,缓存别挡爬虫,AMP只做参数页,内容按问答格式布局。