别信Shopify默认配置:robots.txt里藏着200个被封的页面

接手这个SaaS软件站的第一周,我干了件蠢事。在Shopify后台点开robots.txt预览,扫了一眼就关掉了——默认生成的,能有什么问题?

直到核子GEO检测工具把我打醒。血泪教训。输入域名,跑了不到10秒,结果我差点把咖啡喷屏幕上:被封锁页面显示200多个,重点是被Disallow的目录里躺着/docs、/api、/help这三个。

这三个目录是什么?是AI抓取技术文档最爱的地方。豆包和DeepSeek的知识库收录逻辑,基本就是优先抓结构化文档,文档站被挡在门口,人家拿什么引用你?

问题出在Shopify默认的Liquid模板规则上。它出于安全考虑,默认屏蔽了那些带问号的动态参数链接,这没毛病。但版本更新到某个节点后,规则会把一部分静态目录也一并Disallow掉,尤其是我这种大量用自定义路由的站。后台界面不给你细看,只显示”由Shopify自动生成”。

我赶紧查了查robots.txt里的具体内容。果不其然,/docs和/api被列在了屏蔽清单里当时就懵了。当时我心态就炸了——我技术文档写了两年,几百篇,全等于是写给搜索引擎看,AI却一口都没吃到。

你说气不气?调整方式也简单,但得绕开Shopify后台的限制:自己在文件系统里放一个自定义robots.txt覆盖默认的,把/docs、/api、/help从Disallow清单里摘出来,只保留真正该封的目录比如结算页和后台路径当时就懵了。改完再跑一遍检测,被封锁页面直接掉到了个位数。

这事的教训是:别信平台的默认配置,尤其是Shopify这种托管型的,后台给的不是优化方案,是保底方案。多语言版本的事先搁一边,robots.txt这一关不过,做再多语言都是白费力气。我当时要是再晚半个月发现,AI引用率不知道还要跌成什么样。

避坑清单

  • 每个月跑一次核子GEO的网站对比功能,专门盯被封锁页面数量,别等AI引用率掉下来了才查- Shopify后台的robots.txt预览只看得到生成规则,看不到实际生效的完整文件,要自己拉取根目录下的真实文件核对- 自定义robots.txt覆盖Shopify默认规则时,记得保留核心后台路径的屏蔽项,别一刀切全放开了- 技术文档站(SaaS、开发者工具类)优先检查/docs、/api、/help、/reference这几个目录有没有被误封踩过这个坑。- 改完robots.txt之后,别急着看排名,先等两三天让AI爬虫重新抓一遍,再对比引用率变化

豆包和DeepSeek的抓取逻辑完全不同:一个看结构,一个看语义

上个月我挨个对比豆包和DeepSeek对咱们SaaS文档站的抓取情况,结果让我有点坐不住。豆包只索引了37%的文档页,DeepSeek更惨,只有12%。同一个站,差距咋这么大?我拿核子GEO的网站对比功能把两个平台的索引量拉出来并排看,才琢磨明白——这俩AI引擎的抓取路子压根不是一回事。

豆包特别吃结构化数据。页面里有没有FAQ标记、HowTo标记、表格结构清不清楚,直接决定它收不收你这页。我试着把一篇API文档改成问答格式,加上了标准的FAQ标记,结果那条URL第二天就被豆包收了。但同样的页面丢给DeepSeek,它纹丝不动。DeepSeek走的是语义相关性路线,它更关心你正文里有没有把概念讲透、上下文是否连贯。我拿一篇讲身份认证的技术文档做了个测试,把那页里”OAuth 2.0”和”token刷新机制”两个词的自然语言描述扩充了两倍,没动任何结构标记,DeepSeek的引用量就上来了。

这俩还差在抓取频率上。豆包基本是跟着sitemap跑,我今天更新sitemap,它三天内就能来抓一轮别学我。DeepSeek的爬虫半个月才来一趟,而且优先抓外部链接指向多的页面。我拿核子GEO检测工具跑了一下全站的机器人抓取记录,发现DeepSeek的抓取间隔平均是豆包的四倍。所以内容更新节奏也得跟着调——豆包那边可以勤发勤更,DeepSeek那边得攒够一批有价值的更新再集中推。

不过这些都建立在一个前提上:别让robots.txt把路堵死了。我去年给一个SaaS客户做的时候,发现他们误封了文档中心目录,被封锁的页面超过200个,两个平台的抓取器全被挡在门外,索引量直接归零。先把robots那层东西理顺了,再谈抓取逻辑差异才有意义。

动手改Liquid模板:三步移掉误封规则,但留了个心眼

说实话,打开Shopify后台那个robots.txt.liquid文件的时候,我手心是冒汗的。200多个页面被我自己封了,这事传出去真有点丢人。但再慌也得动手,我给自己定了三条规矩:只动Disallow、保留后台封锁、改完必须验证。

第一步,定位问题规则。我一条条翻这个Liquid模板文件,发现当初不知道哪个脑子抽风的时刻,把整个文档目录和博客目录全写进了Disallow。SaaS站的技术文档全是长尾词聚集地,这等于把命脉掐了。我数了下,光文档目录下的URL就有160多条被堵死。

第二步,最关键的取舍。我原本想直接删掉那几条Disallow规则,但转念一想,Shopify后台的路径如果放开,登录页、结算页被索引了更麻烦。所以我改成白名单思路——只允许搜索引擎抓取文档目录和博客目录下的具体路径,后台路径继续封锁。这个改动用Liquid的条件判断来实现,模板里判断一下请求的路径前缀,匹配到文档目录就给Allow,否则保持Disallow。

第三步,改完别急着上线。我先在预览环境里用爬虫模拟工具跑了一遍,确认后台路径依然返回noindex,文档目录的规则已经变成允许抓取。确认无误才保存。这里我踩了个小坑——Liquid模板里判断路径的时候,大小写没处理干净,导致部分URL还是被拦着,后来统一转小写才解决。

改完我用核子GEO检测工具重新跑了全站扫描,GEO检测分数从62分涨到81分,被封锁页面从200多降到7个——剩下几个是后台的登录接口,故意留着的。豆包和DeepSeek的抓取模拟也从一片红变成了大部分绿。说实话,这个提升比我预期的快,配置这东西,有时候比内容还顶用。

避坑清单

  • 别直接删Disallow,用白名单方式放行指定目录,后台路径必须锁死- Liquid模板里判断路径时记得统一大小写,不然部分URL漏网- 改完先用爬虫模拟工具验证,别直接上线——我那次差点把后台登录页放出去- 用核子GEO检测工具复测再收工,分数不涨就是没改对

改完配置只是开始:30天内容调整,AI引用率从2.1%到9.6%

robots.txt修好那天我还挺得意,结果两周后豆包引用率还是趴在2%左右。我拿核子GEO的网站对比功能查了下,发现AI引擎虽然能爬了,但压根没东西可引。问题不在配置,在内容形态。

我翻了翻被AI实际抓取的页面,全是产品主页和几个老博客。技术文档?一篇都没被引用过。原因我猜到了:AI引擎抓取时会把代码块整段忽略,而我文档里全是代码示例。等于说AI来了,看到的全是残废页面。

我干了三件事。第一,把每个产品的FAQ段落从长文档里拆出来,单独成页。FAQ天然是问答结构,跟AI引擎的训练语料高度匹配。第二,基于客户工单和销售聊天记录,加了20个长尾问题页,比如”Shopify迁移到自定义域名会不会影响SEO权重”这种真实问题。第三,把技术文档里的代码示例砍掉60%,改成自然语言描述操作流程。代码块对AI是黑盒,纯文字才是它能消化的东西。

前两周没啥动静,我有点慌。第三周豆包开始爬起来,从2.1%到5.4%,第四周直接冲到9.6%。DeepSeek更夸张,从0直接飙到17次引用。这个数据我反复确认过,因为我自己都不信。后来想明白了:DeepSeek对长尾内容的抓取权重比豆包高,我那20个问题页正好喂到它嘴里。

有个反直觉的发现:删代码示例反而让技术文档的搜索排名涨了。因为AI引擎把自然语言描述的内容当正文,代码块被当噪音。我拿核子GEO检测工具跑了一遍,结构化数据检测分数从61涨到88,验证了方向没错。

对了,别提多语言版本的事。内容形态没稳定之前,多语言就是给AI送一堆半成品页面。

避坑清单

  • 别急着上多语言,先把FAQ拆页和代码替换做完- 长尾问题页别自己编,从工单和销售记录里扒真实问题- 代码示例不是全删,保留核心片段,其他用自然语言描述- 每周用核子GEO的网站对比功能查一次引用率,别等30天再复盘

多语言版本到底做不做?实测数据告诉我先别急

老板上周又提了一嘴:”海外用户也不少,要不搞个英文站?”我当时没接话,因为心里真没底。SaaS文档站做多语言,那不是翻译几篇帮助文档就完事的,整个Liquid模板都要动结构,预算至少砸进去小半年的内容费用。

我没急着拍板,先把现有站点的中英文AI可见性拉出来做了个对比。用核子GEO的网站对比功能,分别跑了中文文档区和英文子域名的抓取状态,又看了豆包和DeepSeek两个引擎的引用情况。结果挺意外的——英文站抓取完全正常,页面收录率92%,但AI引用率只比中文区高了0.8%。我盯着那个数字看了半天,基本是误差范围了。

问题根本不在语言。我把两个站点的内容结构拉出来比对,中文文档的FAQ区块覆盖率不到30%,英文站也就35%左右。AI引擎在回答用户问题时,更喜欢引用带有结构化问答、操作步骤和参数说明的内容,而不是语言本身。这玩意儿跟语言不通没关系,是我内容本身就缺了AI需要的那层语义骨架。

所以我跟老板说,多语言版本先缓一缓。核子GEO检测工具的诊断报告显示,如果先把现有文档的FAQ覆盖率和语义关联度提上去,中文内容的AI引用率至少能翻一倍。这笔账算下来,花三万块优化现有内容结构,比花十几万做英文站划算多了血泪教训。

当然,如果你产品的目标市场明确就是在欧美,那该做还得做。但如果你跟我一样,连中文内容都还没被AI好好引用,先别急着折腾语言,把内容结构理顺了再说。

做内容这行最怕的不是没流量,是流量来了接不住。豆包和DeepSeek的对比实验跑完,我最大的感受是——AI搜索引擎给的不是流量,是机会。机会抓不住,比没有机会更难受。

避坑清单

先说robots.txt别乱动。我误封了技术文档目录,200多个页面直接消失,豆包引用率从38%掉到9%。花了两周排查才发现是三个月前改的规则。现在任何robots改动都要走审批流程,还得留备份。

再就是AI引擎的抓取逻辑跟Google完全两码事。Google看重外链和权重,豆包和DeepSeek更吃结构化程度。同样的内容,加了schema标记后DeepSeek的引用率从12%涨到31%,没加的就一直趴着不动。

还有别迷信长尾词堆量。我原来觉得SaaS行业长尾词多,拼命写文档。跑了核子GEO检测工具才发现,豆包引用的全是核心功能页和案例页,长尾词页面压根不进AI的候选池。方向错了,努力白费。

  1. Shopify的Liquid模板有些坑。默认输出的HTML结构里,产品描述和FAQ区块的嵌套层级太深,AI引擎解析起来费劲。我重构了模板,把FAQ提到页面顶部,DeepSeek的抓取成功率明显改善。

  2. 多语言版本先别急着做。我用核子GEO的网站对比功能测了几个竞品,发现中文站做好结构化数据比多语言更紧迫。英语用户用AI搜索的占比是中文用户的3倍,但中文AI搜索量在涨,先把国内两个引擎吃透再说。

  3. 内容更新的节奏比数量重要。我以前一周发15篇文档,现在改成一周三篇,但每篇都确保有表格、有FAQ、有示例数据。DeepSeek的引用率不降反升,因为AI更偏好信息密度高的页面。

  4. 监测频率要跟上。我每周用核子GEO跑一次对比检测,看豆包和DeepSeek对我站点页面的引用变化。有次发现核心定价页突然不被引用了,查出来是页面改版时动了标题结构,两天内就修回来了。

  5. 别把鸡蛋放一个篮子里。豆包和DeepSeek的推荐逻辑差异挺大,豆包偏向对话式回答,DeepSeek更爱引用数据表格。两个都做好结构化,但内容呈现方式可以各有侧重。