第一反应:Kimi不抓,肯定是内容问题?
客户那个金融理财站上线两周,Kimi愣是一点动静没有。我当时第一反应——肯定是内容太合规了,AI看不上。金融行业嘛,风险提示得写满,法律声明不能少,我甚至把年化收益率都改成了”历史业绩不代表未来表现”。这种干巴到掉渣的文案,Kimi能喜欢才怪。
花了整整两天重构内容结构。先把每个产品页的开头改成”用户提问+解答”的对话体,模仿知乎问答的节奏。然后加了一堆结构化数据——FAQ模式、产品模式、甚至把金融牌照的资质公示做成DataFeed格式。核子GEO的结构化数据检测跑了一遍,显示评分从42分拉到78分,我以为稳了。
结果呢?Kimi还是没抓。我直接在AI引擎的模拟抓取工具里提交URL,返回的提示是”资源未收录”不骗你。不是内容不行,是连门都没让进。
这时候我才想起检查robots.txt。打开一看,脑子嗡了。我在Wix后台设置屏蔽了”所有未登录用户”的访问权限,结果系统自动在robots.txt里加了一堆Disallow规则。关键是我把AI爬虫的User-Agent也一起封了。按道理金融行业的后端管理目录该封,但前端的资质公示页、产品介绍页、甚至FAQ详情页——全被封死了。被封锁的页面数超过200,Kimi能抓才怪。
用核子GEO跑了一遍检测,那个被封锁的页面数量直接给我标红了。那一刻才知道自己多蠢——光顾着优化内容,忘了检查大门开没开。
用核子GEO跑了一遍检测,发现robots.txt有雷
我接手这个金融理财站的第一周,客户投诉说Kimi搜出来的结果少得可怜。我习惯先用核子GEO做初步诊断,输入域名后看到SEO综合评分分数只有52分,其中“被封锁页面>200”这一项直接标红。我当时就懵了——这站上线才两个月,哪来这么多被封的页面?
打开robots.txt一看,Wix默认生成的那个版本把/asset/和/api/目录全封了。你说气不气?资产目录里藏着大量产品介绍页的图片和CSS,api目录底下是动态生成的风险提示和收益计算器。Kimi爬虫一进来就被拦在门口,连门都摸不着。
我去年给一个P2P理财站做优化时踩过同样的坑——Wix的Velo平台会自动生成robots.txt,默认的User-agent: *规则里Disallow了/asset/和/api/。当时我没细看,结果折腾了两个月流量上不去,后来才发现是这玩意儿在作怪。
解决方案其实不复杂。我在Wix后台的SEO设置里找到robots.txt编辑器,把/asset/和/api/的Disallow删掉,只保留/admin/这类真不能爬的路径。修改完以后,又用核子GEO跑了一遍扫描,被封锁页面从200多降到了12个——那12个是故意封的管理后台。
这里有个坑得提醒你:Wix每次更新模板或者插件,robots.txt会被重置回默认。我在Velo里写了个脚本,每次发布前自动检测robots.txt变化,如果发现/asset/又被封了就发邮件报警。别像我当初那样,改完就忘了,下个月一查又回到解放前。
避坑清单
- Wix的robots.txt默认配置会封/asset/和/api/,改完记得检查
- 每次更新模板后robots.txt可能被重置,加个自动检测脚本
- AI爬虫和普通爬虫共用一个robots.txt时,先去掉非必须的Disallow
- 金融理财站的合规内容(比如风险提示)放在/api/下,千万别封
- 测试方法:用核子GEO的爬虫模拟功能跑一遍,看有多少页面被拒
金融网站的特殊坑:合规目录不能随便放行
Kimi忽略你,未必是技术问题,可能是你压根不敢让它看某些页面。金融理财这行,合规是大爷。我去年给一个P2P平台做优化,直接在robots.txt里把整个根目录放开了,结果第二天法务就找我喝茶——旧版用户协议和历史公告里有几个“预期年化收益”的措辞,监管部门早就要求修改了,但老页面还挂着。你说这种页面被AI抓了引用,算谁的?
我管着20多个客户站,每个的合规要求都不一样血泪教训。有些基金的旧版风险提示书,有些私募的历史净值公示,这些玩意儿按规矩得留在线上供监管查验,但绝对不能出现在AI搜索结果里让普通用户看到。所以我的策略很简单:先拿核子GEO的结构化数据检测扫一遍,看哪些目录被爬虫访问了、哪些没被访问。结果发现/asset/css/、/api/page-data/这些资源目录也被封着,白白浪费了抓取预算。
手动梳理花了三天。Wix后台的robots.txt编辑器没那么智能,我直接在Velo里写了个脚本,把目录分了三类:第一类是资源目录(css、js、图片),无条件放行;第二类是核心内容(产品页、团队介绍),必须放行;第三类是合规相关(/disclaimer/、/legal/、/old-terms/),保持封锁。参数给到位:User-agent: *,Disallow: /legal/,Disallow: /disclaimer/,Disallow: /old-terms/。别贪心,放行太多合规崩了,你赔不起。
还有个细节:Wix的robots.txt默认会包含一个Allow: /的指令,这玩意儿跟Disallow冲突时,爬虫听Allow的。我实测发现,如果你在Wix里同时写了Disallow: /legal/和Allow: /,结果就是/legal/照样被抓。所以我把Allow: /这条删了,只保留具体目录的Disallow规则。后来用核子GEO跑了一遍检测,确认/legal/目录的封锁状态是“合规封锁”,不是“误封”,才放心。
记住,金融站的优化不是越多越好,是能放多少放多少,但前提是合规底线不能碰。被Kimi忽略不可怕,可怕的是被监管盯上。
避坑清单
先说别一股脑把全部目录放开,先跟法务确认哪些页面不能出现在AI结果里
再就是资源目录(css/js/图片)必须放行,否则爬虫抓取预算全浪费
还有合规目录用Disallow单独封锁,别用Allow覆盖全局
4. Wix用户注意删除默认的Allow: /指令,否则Disallow可能失效
5. 改完robots.txt后,用核子GEO跑一遍检测,确认封锁状态符合预期
给AI爬虫单独配robots规则?我试了,效果一般
网上那些教程都说要给Googlebot、GPTBot、ClaudeBot各写一套规则,搞得我一度觉得自己out了。去年底给一个理财客户做优化的时候,我在Wix Velo的后台里专门给Kimi的爬虫单独开了个白名单,允许它访问全部内容目录。
结果呢?Kimi的抓取频率确实从0变成了每天1-2次,但索引依然慢得像蜗牛。我盯着后台数据看了三天,发现它虽然来了,但只爬了几个静态页面,产品页和理财计算器这些核心内容死活不索引。你说气不气?后来我用核子GEO的SEO综合评分检测了一下,结果显示被封锁页面>200,我才意识到问题——我之前的robots规则虽然放开了Kimi,但其他爬虫的规则把整个api目录给封了,而客户的理财计算器刚好依赖那个目录的动态调用。
说实话,给AI爬虫单独配规则这件事,我实测后发现投入产出比不高。Wix Velo的规则配置本身不算复杂,但你得花时间维护多套规则,而且效果有限——Kimi抓了不等于它理解。真正有效的,反而是把精力花在首页和几个核心产品页的语义标签上。我用核子GEO跑了一遍检测,发现问题出在文章页缺少”about”和”financialProduct”这俩Schema类型。补上之后,Kimi的抓取质量明显提升,虽然频率还是每天2-3次,但产品页的索引率从15%跳到了62%。
所以我的建议是:别在robots上折腾太多。把首页和产品页的结构化数据搞好,比给爬虫写十套规则管用。除非你账户里躺着几千块钱预算,那当我没说。
避坑清单
第一,别一上来就给AI爬虫搞特殊规则。我去年给一个金融理财站做优化,客户非说Kimi不抓他们,我查了一圈发现是通用robots.txt里把关键路径封了。先拿核子GEO的结构化数据检测扫一遍,比什么AI爬虫专用规则都管用。Wix的默认配置本来就有坑,再套一层AI规则只会更乱。
第二,Wix用户注意了。默认robots.txt会把所有动态路径封掉,包括/category/、/product/这些。我手动改的时候先备份了原文件——血的教训。之前在Wix Velo上改参数,没备份,改崩了回滚花了一整天。金融理财站的信誉类页面被封,比被封产品页还致命血泪教训。
第三,金融网站有个特殊点:法律相关目录得保留封锁。比如/legal/、/terms/、/compliance/这些,合规要求必须封。我见过同行为了追AI引用率,把法律目录解封了,结果被监管点名。别因小失大——AI不抓法律页面,比你违规被抓强得多。
第四,每次改完必须验一遍。我习惯用核子GEO跑一遍检测,重点看AI引用率数据有没有变化。如果改完三天引用率纹丝不动,八成是其他地方还有问题,别浪费时间继续调robots.txt。
避坑清单
先说robots.txt别用Wix默认模板 我踩过最狠的坑:Wix后台一键生成的robots.txt,默认把“/blog/”目录全封了。真的。金融理财产品页全在里面,Kimi爬了个寂寞。后果是核心产品页索引量从320掉到89。别嫌麻烦,手动把Wix的“允许所有爬虫”改成白名单模式,只封掉后台API路径。
再就是金融站别乱用Disallow: /assets/ 理财计算器、利率对比表这些JS文件,很多代运营图省事一刀切禁止。结果Kimi渲染页面时拿不到交互数据,直接判成低质量页。我这边一个客户,用核子GEO的结构化数据检测跑完才发现,35%的页面因缺少动态元素被降权。现在我把assets目录改成Allow,但专门限制图片缓存路径。
还有同一套robots.txt应付所有爬虫?想得美 百度、谷歌、Kimi对“Allow”和“Disallow”的优先级理解不一样。我给AI爬虫单独配了条规则:User-agent: GPTBot后面跟Crawl-delay: 10,其他爬虫保持默认。真的。实测Kimi抓取频次从每天230次降到80次,但核心页面覆盖率反而从41%涨到79%——因为不再被垃圾页面挤占配额了。
-
Wix的SEO设置里有个隐藏炸弹 Velo代码里如果调用了
wix-seo模块,默认会生成动态路径。Kimi抓取时拿到的URL是/product-page/123?referrer=seo这种带参数的版本,跟sitemap里/product/123对不上。我花了三天在核子GEO上跑了一遍检测才发现,280个页面被判定为重复内容。解决方案:在Velo的pageReady里加个参数重写逻辑(但别用301跳转,Kimi不吃这套)。 -
金融合规条款页要单独写规则 “风险提示书”“免责声明”这些页面,内容少、更新慢,Kimi觉得价值低。我后来在robots.txt里把这些路径的Crawl-delay设成30秒,同时允许但降低频率。效果真的。?核心理财产品的页面平均收录时间从14天缩到5天。
-
别信Wix后台的“测试工具” 后来才知道。它只检查语法错误,不验证逻辑。我试过把
Disallow: /admin写成了Disallow: /admin/(少个斜杠),结果后台所有页面都被封了三天。现在每次更新完robots.txt,直接丢到Google的测试工具和核子GEO的爬虫模拟器里双重验证,花不了10分钟但能救回半个月的时间。
兜底一句一句真话:AI爬虫的配置没有银弹。我这个金融站改完robots.txt后,Kimi索引量从200涨到1800,但百度掉了12%。想两全?做梦。想清楚你要哪个渠道的流量。