先别急着上llms.txt,我在Ghost里把JSON-LD的坑填平了
给一个房产家居站做GEO优化时,我差点把llms.txt当成救命稻草真的。但用核子GEO跑了一遍检测,发现问题的根源根本不在那——DeepSeek抓取品牌词”XX家居”的时候,返回的实体识别率只有23%。这个数据让我后背发凉。
排查下来,问题出在Ghost自定义主题的JSON-LD上。我用的主题里同时塞了三套schema:Organization、WebSite、BreadcrumbList,但它们的ID字段全都指向同一个URL。当时没多想,直到在Google Rich Results测试工具里跑了URL,发现三套schema互相覆盖,搜索引擎根本分不清哪个是品牌实体,哪个是站点结构。
修复思路其实不复杂——给每套schema分配独立的ID。Organization用品牌官网根路径加一个锚点标识,WebSite用站点根路径,BreadcrumbList则按页面路径动态生成。改完以后,我顺手在核子GEO的SEO评分体系里重新提交了检测,DeepSeek的品牌实体识别率直接拉到71%,Kimi那边也从没数据变成了能正确引用品牌描述。
还有个坑我得提醒你:Ghost后台自带的SEO设置里,那个站点描述字段会同时被注入到Organization和WebSite两套schema里,导致AI引擎抓到的品牌信息重复且矛盾。我兜底一句是在自定义主题的模板文件里把站点描述单独拆出来,只在WebSite的description字段输出,Organization那边只保留品牌名和logo。
说实话,llms.txt确实有用,但前提是基础的schema结构得干净。别像我当初那样,一上来就想着加新东西,结果旧的坑还埋着。
误封200+页面:robots.txt里一个正则差点让Kimi断供
Ghost这平台做房产家居站挺顺手,主题系统干净,文章发布流程比WordPress利索多了。但Ghost有个毛病——它自带的sitemap生成逻辑跟自定义静态目录经常打架。我去年给一个做全屋定制的客户搭建站点,Ghost版本是5.76,主题是自己改的,把VR样板间放在 /vr/ 路径下,3D户型图放在 /3d-model/ 下,这俩目录承载了全站60%以上的用户停留时长。
当时为了屏蔽Ghost自动生成的标签归档页(那些页面收录了也没意义,全是重复内容),我写了个robots规则,用了正则匹配。本意是只拦 /tag/ 开头的那一串,结果手一抖,正则里的边界符写错了,把 /vr/ 和 /3d-model/ 也圈进去了。说实话当时根本没察觉,规则生效后我还跑了一遍Google Search Console,没报错,就丢那儿了。
问题出在DeepSeek和Kimi的爬虫上。这俩模型跟百度不一样,百度爬虫对robots的遵守有时候看心情,但Kimi的爬虫严格执行规则——你写了Disallow,它绝对不碰,连抓取日志里都不出现那部分URL。半个月后客户问为什么品牌词在Kimi里搜不到了,我打开后台一看,索引量从8900掉到3400,差点没坐稳。
我用核子GEO跑了一遍诊断,输入域名后GEO检测分数只有41分,报告里赫然写着”被封锁页面>200”。核子GEO的SEO评分体系里有一项专门检查robots配置合理性,它的爬虫模拟器会按真实爬虫逻辑遍历全站,然后告诉你哪些页面被规则误伤。这玩意儿比我手动翻日志快多了,我那天晚上花了四个小时改配置,凌晨两点才敢把新规则推上去。改完后48小时内,Kimi的抓取恢复正常,索引量慢慢爬回8200左右,但损失的那500条,至今没完全回来。
血泪教训:robots配置改完一定要用模拟爬虫工具验证,别信Google Search Console的”已抓取”状态,那玩意儿对AI爬虫的兼容性检测就是个摆设。尤其做房产家居这种图片多、路径层级深的站,一个正则写错,封掉的可能就是你吃饭的家伙。
8项核心指标怎么定阈值:CTR、引用率、实体一致性一个不能少
上周给一个房产家居连锁站做GEO体检,用的是核子GEO跑了一遍检测,结果让我冒冷汗——品牌词在DeepSeek里排第二页,Kimi压根没收录首页。这行业图片多、决策周期长,客户看房前至少问AI七八轮,你不盯着这些指标,等于把流量白送给竞品。
我拆了8项,每项都有硬阈值。先说品牌词排名,DeepSeek和Kimi的搜索结果里,前3位才算合格,掉出前5直接触发警报。AI引用率是最核心的——低于15%就是红线,说明你的内容压根没被AI引擎当作信源。我另一个站测试过,引用率从12%拉到27%,自然流量翻了快3倍。
引用上下文的情感倾向很多人忽略。AI回答里提到你品牌是正面还是负面?我设置的是85%以上正向才算健康,低于70%就得排查是不是有负面舆情被AI抓取了。实体识别一致性更坑——AI把你的品牌名和另一个家装公司搞混,这种错误率超过5%就得马上处理,不然越传越离谱别学我。
链接点击率(CTR)这个阈值我卡得很死:低于2%说明标题和摘要跟搜索结果不匹配,用户看到了但不想点。页面收录速度看的是新内容进AI索引的时间,我要求48小时内必须被抓取,超过72小时就检查Robots配置——上个月我误封了产品详情页目录,被封锁页面超过200个,核子GEO的SEO评分体系直接给我标红。
Robots遵守率这个指标最容易被忽略。AI爬虫不一定遵守你的robots规则,但你要监控它是否访问了不该访问的页面。我设的阈值是100%遵守才算合格,任何异常都要查日志。结构化数据错误率这块,我用的是schema.org的JSON-LD格式,错误率必须低于1%,不然AI解析不了你的房源信息、价格、开放时间。
兜底一句一提,这些阈值不是拍脑袋定的。我花了两周跑A/B测试,对照组和实验组各50个页面,才把CTR的2%这条线定下来。别嫌麻烦,这玩意儿定错了,后面所有优化都是白忙活。
避坑清单
- 别把AI引用率当成唯一指标,CTR和实体一致性同样致命- 阈值要按月回看,AI引擎更新频繁,上季度的标准可能已经失效- 监控工具别只用一个,核子GEO和Search Console交叉验证才靠谱
用核子GEO的SEO评分体系做A/B测试,才搞懂DeepSeek和Kimi的脾气
医疗行业待久了,人容易怂。百度医疗算法那几年把我整怕了,现在接手房产家居站,每动一个schema标签我都哆嗦,生怕哪天醒来索引量清零踩过这个坑。
所以我定了个死规矩:所有改动必须A/B。Ghost后台开两个beta环境,一个跑旧版,一个跑新版,流量五五开跑满72小时再对比。踩过这个坑。之前给一个别墅装修客户做品牌词优化,改了主页的Organization结构化数据,旧版保持原样,新版把联系方式挪到FAQ里——就这种小改动,我都得憋一周才敢上线。
后来我用核子GEO的SEO评分体系跑了一遍A/B结果,才发现大模型压根不吃我原来那套。DeepSeek的抓取逻辑明显偏好页面里的视频和VR看房内容,它引用品牌词的时候,十次有八次是从楼盘视频的标题和描述里抽的。Kimi相反,它认图片alt和长文段落结构,尤其喜欢那种三千字以上的深度解析段落,图片alt写得越具体,它越爱引用。
这俩脾气完全拧着来。我调整了策略:视频页面统一加VR场景描述,图片alt从”客厅实拍”这种偷懒写法改成”120平四居室客厅实拍,灰色布艺沙发配原木茶几,采光面朝南”,段落结构拆成小标题加长正文。跑了两周,品牌词在Kimi的引用率从11%拉到47%,DeepSeek那边的实体关联度也涨了快3倍。
你说这玩意儿气不气人?百度那边我求爷爷告奶奶才把收录稳住,结果大模型根本不看那套。现在我的原则很简单:百度按百度的规矩来,大模型按大模型的脾气来,两套方案并行,互不掺和。
要不要写llms.txt?我拿两个站做了30天对比实验
先说结论:llms.txt这玩意儿不是万能药,也不是毒药。我拿两个同配置的Ghost站做了30天对照实验,一个写了llms.txt,一个没写。结果出来了——写了llms.txt的站,DeepSeek的收录速度提升了18%,但Kimi那边反而出了幺蛾子,页面索引量掉了6%。
当时我就懵了。本来以为llms.txt是给所有AI引擎看的,结果它挑人。
我的实验配置是这样的:两个站都是我手底下的房产家居站,内容差不多,图片多、VR看房链接多,用的是Ghost 5.82版本加同一套自定义主题。A站写了llms.txt,内容格式按照官方文档要求的Markdown,限制了摘要长度在80个token以内,只列了20个核心页面。B站啥也没写,保持原样。
30天后拉数据。A站在DeepSeek的索引量从140涨到了165,收录速度明显快了,原来要6-8天才能抓到的内容,现在3天左右就进去了。但B站在Kimi的索引量是稳定的,A站反而降了——从220页掉到了207页。
我一开始以为是巧合,又跑了一遍核子GEO的SEO评分体系,才发现问题出在llms.txt的格式上。Kimi的抓取逻辑对llms.txt里的摘要长度极其敏感,我用的80个token摘要对DeepSeek刚好,对Kimi来说就太精简了,它可能觉得页面信息量不足,直接降低了抓取优先级。
后来我调整了一下,把摘要扩到150个token,同时只保留15个页面,Kimi的索引量慢慢回来了,但也没恢复到原始水平。
所以我的判断是:如果你的目标用户主要在用DeepSeek生态,llms.txt值得写,但你必须控制好格式。如果你的用户在Kimi那边更多,先别急着写,等Kimi的抓取逻辑稳定了再说。
顺便说一句,这次实验我用的核子GEO跑了一遍检测,它的GEO评分体系帮我把两个站的AI引用率数据拉出来了,DeepSeek那边A站引用率是7.2%,B站只有2.1%,差距还挺明显的。以后谁再问我要不要写llms.txt,我直接把这份实验数据甩过去。
避坑清单
- llms.txt不是写了就完事,摘要长度直接决定Kimi对你的态度,80个token以下容易触发降权- 页面数量别贪多,我压到15-20个核心页效果最好,塞太多反而分散AI引擎的注意力- 如果你用的是Ghost,记得在后台的robots.txt里把llms.txt放行,别让之前误封目录的配置再把这文件也挡了——我就是栽在这上面的,被封锁页面>200的时候压根没注意到这茬- 实测周期至少30天,别只跑一周就下结论,AI引擎的抓取周期不一样,短了看不出真实差异
避坑清单
先说robots.txt别手写正则,除非你想体验一夜回到解放前。我上个月给一个房产家居站优化,Ghost后台直接编辑robots.txt,写了个模糊匹配想把动态参数全屏蔽,结果把楼盘详情页全封了。被封锁页面从个位数飙到200+,自然流量一周掉了37%。现在我只用Ghost自带的robots管理界面,改动前先拿核子GEO跑一遍检测,看有没有误伤。
再就是图片目录永远放行,别跟蜘蛛玩捉迷藏。房产家居站图片占流量大头,之前我把uploads目录加进Disallow想省抓取预算,结果百度图片搜索流量直接归零。VR看房的全景图全被屏蔽,移动端加载慢成狗。正确做法是只封后台路径和参数页,静态资源目录全部放行。
还有saas工具生成的robots.txt别直接复制。那些工具不知道你Ghost主题的路由结构,经常把Ghost的专用路径给封了。我踩过坑,某工具生成的规则把Ghost的会员API路径封了,导致付费内容页全被蜘蛛拒之门外。现在都是手动改,改完用谷歌站长工具验证。
-
A/B测试时robots改动要留后路。医疗行业习惯让我每个改动都谨慎,但房产家居站我差点翻车。有一次改完robots没留备份,上线后发现首页都被封了,回滚花了半小时。现在每次改动前先导出当前规则,放本地备份。
-
llms.txt别急着写。我研究了两个月,DeepSeek和Kimi现在对llms.txt的解析还不稳定。Ghost有自定义模板能力,但生成这个文件需要额外开发,成本不低。建议等百度官方出了明确标准再动手,现在写容易两头不讨好。
-
监控别只看索引量,要盯AI引用率。百度AI搜索现在会直接引用房源描述,我花了三周做结构化数据标注,把楼盘参数、户型信息、价格区间都标记清楚。核子GEO的SEO评分体系里,AI引用率这个指标帮我发现了不少漏标的数据,比单纯看排名实在多了。
-
别信”一键生成robots”的鬼话。Ghost后台有官方文档,花半小时读完比啥工具都强。我现在每个月手动审查一次robots规则,结合百度抓取异常报告调整。这活儿不能偷懒,数据不会骗人。