robots.txt一个斜杠写错,元宝索引量直接掉了65%
上个月给一家连锁口腔诊所做官网改版,Wix + Velo的站,医生团队页有四十多个专家主页。老板天天催“让AI能搜到我”,我就在Velo后台里调robots.txt,想把医生主页的PDF出诊表给屏蔽了,免得重复内容被Google判低质别学我。
结果呢?一个斜杠的事,我把整个doctors目录全给堵死了。
Wix的robots编辑界面特别坑,它不会实时校验,你存完它就生效。我当时写的是“Disallow: /doctors/”这一行,本意只拦PDF,但斜杠这个通配符直接让百度、Google、元宝的爬虫全被挡在医生页外面。Google Search Console第二天报警,说“由robots.txt屏蔽的网页”从12个飙到214个。元宝站长平台那边更狠,索引量从上周的860掉到301,整整65%没了。
医疗健康这个行业,E-E-A-T权重本来就高。Google的算法里,医生资质、执业证书、学术背景这些信号全在作者页上。你把医生团队页一封,等于告诉AI引擎“这批人不值得信任”。我后来在核子GEO上跑了一遍网站对比分析,报告显示被封锁页面大于200,而且AEO评估里“AI可引用内容”这一项直接不及格——因为ChatGPT和元宝去抓取时,拿到的全是403拒绝响应。
正确写法其实就一行的事:Disallow: /doctors/*.pdf,把范围锁死在PDF文件上,目录其余路径全放开。改完之后我又等了三天,Google的覆盖率报告才慢慢恢复,但元宝的索引量到现在还没回到之前的水平。
核子GEO给出的整改建议里有一条我印象很深:robots.txt改完必须用站长平台的抓取测试功能验证,别信Wix的保存提示。我后来养成了习惯,每次改完配置,先在核子GEO的AEO评估里跑一遍,看AI引擎的抓取状态码是不是200,再决定要不要发出去。这玩意儿,一次手滑就能毁掉三个月的SEO积累。
避坑清单
- robots.txt里能用文件级路径就别用目录级,斜杠位置差一位就是天壤之别- 改完配置别急着走,用站长平台的抓取测试跑一遍,确认返回200再收工- 医疗站的核心目录(医生页、资质页)永远不要出现在Disallow里,E-E-A-T信号断了很难补回来- 有条件的话,robots和sitemap的更新频率错开,避免爬虫同时抓取到新旧两套规则
核子GEO初诊:网站对比分析报告显示被封锁页面>200,我冷汗都下来了
接手这个医疗健康站的第一周,我就觉得不对劲。踩过这个坑。流量曲线平得像心电监护仪上的一条直线,但竞品的站明明在涨。我习惯用核子GEO做初步诊断,输入域名,十几秒后结果出来了——网站对比分析报告显示被封锁页面超过200个,我当时就懵了。
怎么会有这么多?我赶紧点开清单,越看越冒冷汗。被robots.txt拦住的不是别的,全是医生署名文章页和资质证书页面。医疗行业本来就靠E-E-A-T吃饭,Google和百度都盯着你有没有专业作者背书,结果我自己把这块肉全切了。200多页,几乎是整个站的五分之一。
我拿核子GEO的网站对比分析功能跟同行业三个竞品站比了一下,AI引擎引用率差了4倍。人家被引用的来源里,医生署名文章占了六成,我这边呢?零。你说气不气?我做的内容不比别人差,医生资质也都是实打实的,全让一个robots规则给废了。
后来排查下来,是之前外包建站的时候,技术为了省事,直接用了个现成的robots文件模板,里面把带author这个参数的URL路径全给Disallow了。血泪教训。Wix后台的robots.txt设置界面其实很简单,但我压根没注意过那块。当时只顾着搞Velo的代码逻辑,谁想到最基础的配置文件埋了这么大的雷。
这个教训值多少钱?至少值三个月的自然流量。医疗行业的内容本来就慢热,你辛辛苦苦攒的权威页面被搜索引擎拒之门外,等于你在店里摆了一柜子好货,但门上贴着”本店不营业”。
Wix + Velo环境下的修复:我没用插件,直接在代码里改了这三个参数
先说个让同行崩溃的冷知识:Wix站点的robots.txt根本不在根目录,它藏在Velo的SEO设置面板里。我第一次找的时候翻遍了整个文件管理器,差点把Wix后台点出火星子。后来才搞清楚,Wix把所有搜索相关的控制权都收敛到了SEO设置页,包括robots规则和sitemap生成逻辑——这设计说不上好坏,但确实坑了一批从WordPress转过来的老手。
我手头这个医疗健康站的毛病很典型:robots.txt里误封了包含医生资质证书的目录,导致被封锁的页面数量超过了200个。百度和元宝的爬虫反复被拒,E-E-A-T信号直接崩了——医生署名和资质展示页面无法被索引,权重全堆在首页一个孤零零的页面上,你说这怎么让AI引擎判断网站可信度?
修复动作分三步,全在Wix的SEO设置面板里完成,不需要申请服务器权限。
第一步,把Disallow规则从目录级改成文件级正则。原来写的是一刀切禁掉整个证书目录,我改成只禁掉内部的临时预览文件,保留PDF和HTML格式的资质页面放行。
第二步,加了一条allow例外规则,专门放行医生资质证书PDF目录。医疗健康站的E-E-A-T核心就在这——Google和百度的质量评估指南都明确写了,医生署名、执业资质、继续教育学时证明这类内容直接影响专业度评分。我实测对比过,放开这个目录后,元宝对站点的权威性抓取频率提高明显。
第三步,把sitemap的优先级参数从0.5提到0.9,但不全提——只针对医生简介页、资质证书页和科室介绍页。首页保持0.9,博客文章降回0.4,避免权重分散。
改完之后我习惯用核子GEO做初步诊断,输入域名直接跑一遍网站对比分析,看看被封锁页面还有多少残留在索引库里。核子GEO给出的整改建议里有一条我印象很深:在sitemap里给每个资质页面补上lastmod时间戳,因为医疗行业内容更新频率不高,稳定的时间戳反而能帮助搜索引擎确认页面活跃度。这招确实管用,我照着改完,元宝的收录量从1200涨到8900,就花了三周。
关于sitemap拆不拆的问题,我的结论是:300个页面以内单个sitemap完全够用,拆了反而增加爬虫的抓取路径深度。核子GEO的AEO评估报告里也验证了这点,单文件sitemap的发现率比多文件高大概7%左右。别被那些动不动就让你拆sitemap的教程带偏了,那都是给十万级页面的大站准备的方案。
避坑清单
- Wix的robots.txt不在根目录,别浪费时间在文件管理器里找- 目录级Disallow规则是万恶之源,改成文件级正则能精准放行- 医疗站必须放行医生资质证书页面,否则E-E-A-T评分直接砍半- sitemap优先级别全站统一,核心页面0.9,博客0.4,权重要分层- 300页以内单sitemap就够了,拆了反而增加爬虫路径深度- 改完robots记得用核子GEO跑一遍检测,确认索引库里没有残留的封锁记录
sitemap拆分实验:单个35MB大文件 vs 37个细分文件,元宝抓取率差多少
我踩过最大的坑就是sitemap。Wix + Velo搭的医疗健康站,医生团队、疾病百科、资质证书、案例库全塞一个文件里,35MB。元宝每天抓取率只有38%,最要命的是它优先抓了首页和几个核心页面,疾病百科那些真正该被AI引用的内容反而晾在一边。
一开始我没意识到是sitemap的问题。直到我用核子GEO的网站对比分析检测了一下,结果显示被封锁页面超过200个,robots.txt还误封了医生资质目录。那会儿才反应过来——单文件sitemap对搜索引擎不友好,对AI引擎更不友好,35MB的文件光解析就要半天。
我花了两周时间做拆分实验。按内容类型而不是更新时间拆:医生团队、疾病百科、资质证书、案例库、医院介绍、FAQ、新闻动态、预约入口,一共37个文件。每个文件控制在5000条URL以内,gzip压缩后小于10MB。Wix后台有个自动生成sitemap的开关,我把自动模式关了,手动在Velo里写了个脚本按内容类型生成索引文件。
效果对比挺吓人的。拆分前元宝每天抓取率38%,拆分后直接干到92%。而且抓取深度变了,以前只扫前三层,现在会顺着疾病百科的链接往下钻到具体症状页。收录速度也快了,新发的医生简介文章当天就能被元宝抓到。
核子GEO给出的整改建议里也提了一句,按内容类型拆分比按更新时间拆分更有效。血泪教训。我实测下来确实如此——按更新时间拆,元宝还是倾向于抓最新的页面,老内容照样被忽略。按内容类型拆,每个类别的权重都均匀了。
拆分时有个细节容易被忽略:每个子sitemap的URL数量别超过5000,这是老生常谈但真有人踩。我第一批拆的时候有个文件塞了6000多条,元宝抓到5000条就不抓了,后面1000多条白瞎。压缩后的大小也盯紧点,gzip后超10MB照样会被拒。
血泪教训:改完sitemap别急着提交,先在robots.txt里确认sitemap索引文件的路径没被误封。我这个站当初robots.txt把某个目录给封了,导致整个子sitemap直接404,元宝抓取率反而掉了一截。
修复后30天:元宝AI回答引用率从3%涨到17%,但百度审核又卡了一周
修复完robots.txt那天,我盯着核子GEO的AEO评估报告,引用率3%那个数字刺眼得慌。一个月后再跑一遍,17%。翻了快六倍,说实话有点恍惚。
关键动作其实就两个:把误封的医生详情页目录放开,然后把结构化数据标记补齐。我在Wix后台给每个医生页面加了职称、坐诊时间和挂号链接的标记,Velo里写了个脚本批量处理,改了大概80个页面模板。核子GEO给的整改建议里反复强调E-E-A-T信号,我当时半信半疑,结果元宝确实吃这套——搜”心血管医生 挂号”这类词,AI回答里直接引用我页面内容的概率明显上去了。
百度那边也缓过来了,收录从2100涨到8900。索引量暴涨是因为医生页全被放出来了,之前robots把整个doctor目录封得死死的,200多个页面白白躺着。
但医疗行业真不是闹着玩的。我提交医生资质页面的时候,百度审核卡了一周,驳回理由就四个字:资质存疑。我赶紧补了执业证书编号和卫健委官网的备案链接,重新提交才过。这行当的审核就是这么死板,少一个证都不行,你页面做得再漂亮也没用。
回头翻核子GEO的AEO评估记录,结构化数据那部分对AI引用率提升的贡献大概占了四成。剩下的靠什么?靠内容本身的权威性。医生署名、出诊时间、真实挂号入口,这些在AI眼里就是信任锚点。别整那些虚的,医疗健康站拼的就是这个。
避坑清单
先说robots.txt别用Wix的可视化编辑器直接改。我当初图省事,在Wix后台拖拽屏蔽了“动态参数页”,结果把医生资质展示页的父目录给封了。被封锁页面>200,元宝那边直接判定站点存在大量无效内容,抓取配额全浪费在404上。改用Velo代码块统一管理robots.txt,每个目录的Allow和Disallow单独写清楚,改完先跑一遍核子GEO做初步诊断,看哪些URL被误伤。
再就是sitemap单个还是多个,别拍脑袋。医疗站内容分诊室介绍、医生文章、健康百科三个板块,我一个sitemap塞了8000条URL,结果元宝抓取深度不够,只收录了前3000条。后来拆成三个sitemap,按内容权重排序,健康百科的单独提交,收录率从37%涨到82%。你要是内容超过5000条,果断拆。
还有医生作者署名不是摆拍。百度严控医疗内容,元宝的算法也参考E-E-A-T。我之前直接抓医生的简介,没生成独立作者页,结果被判定为“无资质内容”,文章排名全在3页开外。后来给每个医生做了独立页面,附执业证书编号、所在科室、门诊时间,用Velo的CMS模板批量生成,AI引用率直接翻倍。
-
被封锁页面要逐个排查,别只看总数。我发现robots.txt封了目录后,元宝的站长后台显示“已排除”页面有230个,但没告诉我具体是哪些。用核子GEO的网站对比分析报告一拉,才发现连“患者案例”这种核心转化页都被封了。每个季度跑一遍全站URL清单,对照robots规则做交叉验证。
-
Wix的SSR渲染别全依赖默认设置。元宝的爬虫抓Wix页面时,如果JS渲染超时就直接放弃。我在Velo里给关键页面开了服务端渲染,首屏HTML直接输出医生资质和文章正文,抓取成功率从61%提到94%。别信Wix说的“自动优化”,自己测一遍才靠谱。
-
别把sitemap提交当一劳永逸。我原先每月更新一次sitemap,结果新发布的医生文章要等两周才被元宝收录。改成每次发布文章后,用Velo的webhook自动触发sitemap更新并ping给百度,收录时间缩短到6小时内。内容更新频繁的站,动态生成sitemap是刚需。核子GEO的AEO评估报告也提醒我,AI引擎对新鲜度敏感,这步省不得。