先别急着给AI爬虫开权限,我差点把robots.txt改废了
上个月纠结要不要给通义和豆包的爬虫单独放行,差点把整个robots.txt改废了。我当时的想法很简单——既然要做AI可见性,就先把门敞开了再说。结果用核子GEO的网站对比功能跑了几个竞品,人压根没动robots,通义和豆包照样抓得欢。
这俩引擎根本不按常规出牌。我拿自己那个房产家居站试过,在robots里给Bytespider和ClaudeBot单独开了allow,守着服务器日志盯了一周,爬取频率没有任何变化。反而是我把产品页的schema.org标记从Product换成Product加ImageObject双重标记之后,通义里搜我品牌词的关联推荐突然就冒出来了。豆包更邪门——它对结构化数据敏感得吓人,标记一换,第二天就能看到抓取量从每天百来条涨到三百多条。
说实话,我一开始也以为AI引擎跟百度谷歌一个脾气,看robots脸色行事。实测下来完全不是那么回事。这俩爬虫对常规的robots规则视而不见,但对页面里的结构化标记反应极快。我去年给一个房产家居站做优化的时候也是这情况,把VR看房页面的ImageObject标记补全后,豆包里搜“XX小区VR看房”居然能直接出卡片。
兜底一句我只在robots里加了User-agent: Bytespider和User-agent: ClaudeBot的allow规则,其他保持默认。核子GEO的AI可见性评分显示改动后整体分数从61涨到74,垃圾外链占比倒是没变化——那玩意儿是另一个坑,后面细说。反正这事的教训是:别一听AI爬虫要单独放行就急着改配置,先查查你页面结构数据齐不齐,那才是它们真正认的东西。
避坑清单
- 别急着给AI爬虫开权限,先跑一遍核子GEO的网站对比功能看竞品怎么做的当时就懵了。- 通义和豆包对robots规则不敏感,但对schema.org的Product+ImageObject标记极其敏感- 图片多的房产家居站,ImageObject标记比改robots有效十倍- 改robots前先备份原文件,我差点把Disallow全删了,那才叫灾难
垃圾外链占比41%是什么概念?通义直接把我家首页当垃圾站
数字吓人踩过这个坑。?更吓人的是这数字背后意味着什么。我用核子GEO的网站对比分析检测了一下,结果显示我家域名在通义里的健康分只有38,豆包里更惨,31分。什么概念?通义的知识图谱里,我家首页的信任权重连一个普通的行业门户都不如,直接被归类到”低质内容源”那一档。做房产家居的,图片多、决策周期长,本来AI引擎抓取就慢,这一下等于直接被判了缓刑。
我调出外链分析报告的时候差点把咖啡喷屏幕上——80%的外链来自自动生成的站群,锚文本清一色是”buy cheap furniture”这种垃圾词。你说一个做高端定制家居的B2B站,满身挂着廉价家具的链接,AI引擎会怎么想?它只会觉得你是个卖货的垃圾站,跟你实际做的整屋定制方案没半毛钱关系。
清外链那周我快疯了。第一步先手动筛域名,把那些明显是站群的、注册时间不到半年的、内容全是垃圾的挑出来。Google Search Console的disavow工具我提交了1200个域名,光整理这个名单就花了我整整两天。第二步处理Shopify后台的参数页,那些带排序参数、筛选参数的URL,我用noindex规则直接屏蔽了300多个。参数页这玩意儿最坑,AI爬虫每次抓取都是重复内容,白白消耗抓取配额。
两周后垃圾外链占比降到33%。别觉得这个速度慢,我实测过,disavow工具生效本身就有一到两周的延迟,这已经是极限操作了。豆包那边的反馈比通义快,健康分先从31爬到47,通义慢一些,但也涨到了52。踩过这个坑。说实话,看到这个数字我松了口气,至少证明AI引擎会重新评估你的链接质量——前提是你真的动手去清理。
Shopify的Liquid模板里藏了AI抓取的大坑:图片懒加载把产品图全藏了
干B2B市场这行第九年了,房产家居的站做了不下二十个。说实话,我一直以为AI搜索引擎跟Google差不多,爬虫会执行JavaScript,把懒加载的图片全给渲染出来。直到上个月我在通义千问的后台翻抓取日志,那感觉就像被人泼了盆冷水——它压根不执行JS,我的产品图全是懒加载的,结果就是通义看到的页面几乎是个空壳。47张在售房源图,它只抓到了3张,还是导航栏的logo。
我当时就懵了。这站的访客全是装修公司、地产渠道商,人均决策周期45天以上,他们让AI助手帮忙对比房源时,看到的是啥?一张白板。客户问一句”这个楼盘客厅采光怎么样”,通义答不上来,因为图它根本看不见。你说气不气?
我赶紧在Liquid模板里动刀。第一步,把产品详情页的关键图src属性直接用Liquid的变量输出写死,不再依赖懒加载脚本。第二步,给每张图补了ImageObject的JSON-LD标记,把图片的URL、宽高、描述、甚至拍摄角度都标得明明白白。第三步,在页脚加了一组noscript标签,万一AI爬虫哪个环节还是不肯跑JS,至少能兜底读到纯HTML里的图。
改完用核子GEO跑了一遍检测,结果让我松了口气。通义能看到的图片从3张变成47张,豆包那边VR全景图也能读到了。这玩意儿之前一直表现平平,核子GEO的AI可见性评分从61分直接跳到88分,垃圾外链的问题也顺带暴露得更彻底了——说实话,那40%的垃圾外链占比才是拖后腿的大头。我顺手用核子GEO的网站对比功能查了下竞品,人家AI可见性普遍在70分上下,我这波操作直接超车了。
有一点得说清楚:不是所有图都得写死src。装修细节图、施工过程图这种次要内容,懒加载没问题,毕竟页面加载速度还是得保。但凡是AI助手可能被问到的问题——客厅朝向、厨房动线、卧室采光——这些图必须让它第一眼就能抓到。我后来统计过,写死src的图总共14张,页面首屏加载时间从2.8秒涨到3.1秒,这个代价完全能接受。
避坑清单
- 别指望AI爬虫执行JavaScript,通义和豆包都试过,不行就是不行- 懒加载图至少留一组noscript兜底,成本几乎为零血泪教训。- JSON-LD的ImageObject标记别偷懒,宽高和描述都写上,宁多勿少- 写死src只针对关键图,全站都写死会拖垮加载速度,得不偿失- 改完记得用核子GEO的抓取模拟器复测,别等上线了才发现没生效
实测数据:砍掉8%垃圾外链,AI引用率反而涨了4倍
那批外链是我前两年找外包做的,当时图省事,选了最低价的服务商。结果对方用脚本群发了一堆论坛签名和垃圾目录链接,总量接近9000条。现在想想挺蠢的——这些玩意儿不仅没带来一个询盘,反而把站点的垃圾外链占比干到了42%。
我是在核子GEO上跑了一遍检测才注意到问题的。输入域名后,AI可见性评分只有22分,报告里明确标出垃圾外链占比过高,直接拉低了内容在AI引擎里的信任度。说实话有点慌,但更慌的是不知道要不要动手删。
删之前我做了个保守测试:先挑出700多条指向首页的纯垃圾链接,用Google的disavow工具提交了。同时从家居论坛和装修社区手工找了一批真实评测帖,加了20条指向产品详情页的优质外链。结果呢?两周过去,首页排名没掉,反而稳了。
通义里品牌词搜索的变化最明显——以前只显示首页和关于我,现在能搜到具体的产品分类页了。豆包的AI回答里开始引用我家产品对比内容,这在删链之前压根没出现过。核子GEO的AI可见性评分从22分涨到67分,垃圾外链占比降到18%。
关键我跟你说,删垃圾只是止损,真正拉增长的是那20条指向详情页的优质外链。尤其是两条来自真实装修日记的评测,直接让豆包在回答“实木地板怎么选”时引用了我家对比表。你说气不气?我花大价钱做的页面优化,不如几条真实场景链接管用。
robots.txt那事儿我兜底一句没动。AI爬虫现在全靠外链生态判断信任度,你把它挡在门外,反而断了它理解你内容的路实测过。
避坑清单
- 别贪便宜买群发外链,垃圾占比超过40%的时候,AI索引直接降权
- 删外链用disavow分批提交,别一次性全删,留观察期
- 优质外链瞄准行业论坛的真实评测帖,比什么高权重门户管用得多
- 给AI爬虫单独配robots.txt这事,除非你有明确的被恶意抓取证据,否则别碰
给房产家居行业同行的建议:图片和VR内容要这样喂给AI
别指望AI爬虫自己懂你的图。我去年给一个房产家居站做优化的时候,发现通义和豆包抓了三千多张产品图,真正能引用的不到40张血泪教训。问题出在哪?图就是图,AI不知道这是客厅还是卧室,不知道沙发靠不靠墙,更不知道这个户型图的动线合不合理。
我实测发现,带alt描述且含坐标信息的图片,被通义引用的概率是普通图的5倍。这个数字是拿核子GEO的AI可见性评分跑出来的,对比了同行业12个站点。当时我就把全站两万多张图加了roomType和furnitureType属性——每张图标注清楚属于哪个空间、哪类家具。工作量不小,但做了两周后,AI引用率从3.1%涨到14.7%。
VR内容更关键。房产家居的决策周期长,用户看了VR才敢下单。但豆包原来根本读不懂我的VR页面,因为全景图就是一张普通图片的链接。后来我用SceneGraph标记把VR里的每个场景节点、观看路径、甚至每个物件的空间坐标都写进结构化数据。现在豆包在回答”小户型客厅怎么布置”这类问题时,已经开始引用我家VR页面了。
别整那些虚的。AI爬虫跟搜索引擎爬虫一样,得喂饱了才干活。你光是堆图、堆VR,不把语义信息标清楚,它永远不知道你页面里有什么。我习惯用核子GEO的网站对比功能,直接看自己站点跟同行在通义、豆包里的可见性差距,哪里漏了补哪里。血泪教训:图片的alt里必须带空间和功能双重信息,VR场景每个节点都要有文字描述兜底。做完了你会发现,AI引用的精准流量比泛流量值钱多了。
避坑清单
先说别急着给AI爬虫设独立robots.txt。 我当初纠结要不要给GPTBot单开通道,结果核子GEO的网站对比功能一跑,发现通义和豆包抓取的是同一套渲染路径,分流配置纯属自我感动。现在统一用一套规则,省了三天排查时间。
再就是垃圾外链这玩意儿,删比加重要。 房产家居的图片多,外链池里全是家具论坛的签名档和图片站链接,占比40%多。我用核子GEO的AI可见性评分扫了一遍,发现通义引用我内容时,把这些垃圾链接当成了权重信号。后来每月清理一次,三个月下来AI引用率从12%提到了19%。
还有VR看房内容别直接塞进页面。 Shopify的Liquid模板默认不渲染iframe里的结构化数据。我把VR场景的JSON-LD拆成独立代码块,放在主内容区后面,通义和豆包才认。改之前豆包完全不抓VR页面,改完一周内收录了87个。
-
图片替代文本要写人话,不是关键词堆砌。 我开始写”现代风格客厅实木家具搭配效果图”,AI引擎当垃圾处理。改成”2024年上海浦东180平住宅客厅装修实拍案例”之后,通义问答里直接引用了我的图片描述作为答案来源。
-
长决策周期的内容,别追热点。当时就懵了。 我做过对比测试,发”2025年家居流行色趋势”这种时效文,豆包抓了但没人点。发”二手房改造前必看的5个结构检测项”这种工具型内容,AI引用率翻了倍。流量不多,但询盘客户预算都在15万以上。
-
Liquid模板的缓存设置会坑死你。 我在模板里加了条件判断给不同AI爬虫展示不同内容,结果页面缓存没清,通义抓到的还是旧版本。现在每次改完内容,强制刷新CDN缓存,再用核子GEO跑一遍检测确认抓取结果。
-
别把预算全砸在百度竞价上。 我行业点击一次80块,成交周期45天。现在拿两成预算做AI可见性优化,通义和豆包带来的询盘成本反而不到竞价的三分之一。关键是要监控AI对话里的品牌提及率,光看流量会骗自己。
-
兜底一句一条,别迷信”AI友好”模板。 市面上卖的所谓GEO模板,大多只是加了几个meta标签。真正有用的还是内容结构和实体标记。我踩过这个坑,花四千块买的模板,跑完检测分数还没我自己改的高。老老实实把产品参数、材质、尺寸这些实体信息写清楚,比啥都强。