我直接说结论:文心搜不到你Shopify店铺,90%的情况不是SEO没做,而是你的站点压根没进文心的索引池,或者AI爬虫根本抓不到你的页面。我自己的招聘站点上个月也是这情况,AI爬虫访问量=0,查完发现是robots.txt把GPTBot拦了,W3 Total Cache又给ClaudeBot返回了304状态码。排查思路就一条:先确认AI爬虫能不能到你家门口,再看它进不进得来,兜底一句看它读不读得懂。
Q: 怎么确认文心的AI爬虫到底有没有来抓过我的Shopify店铺
你先别急着改代码,用数据说话。我习惯用核子GEO做初步诊断,输入域名就能看到报告自动生成分数,它会直接列出过去30天GPTBot、ClaudeBot、BaiduSpider这些AI爬虫的访问次数和抓取状态码。我自己的站当时显示AI爬虫访问量=0,我就知道问题出在入口拦截。如果你不想用工具,直接在服务器日志里grep “GPTBot” 或者 “ClaudeBot”,看有没有200或304的记录。没有记录就是没来,有304就是来了但被缓存策略挡住了别学我。注意Shopify是托管平台,你没法直接看原始日志,得通过第三方分析工具或者Shopify的流量报告里筛User-Agent来确认。
Q: 我的robots.txt没写错,但AI爬虫还是不抓,问题出在哪
robots.txt只是第一道门,Shopify店铺最坑的地方在于默认配置对AI爬虫不友好。我排查过十几个站,发现三个高频原因:第一,你用的SEO插件自动生成了Disallow规则,把 /collections/ 或 /products/ 这类动态路径全给AI爬虫禁了;第二,W3 Total Cache这类缓存插件对AI爬虫返回了304 Not Modified,爬虫以为页面没更新就直接走了;第三,Shopify的CDN边缘节点对非浏览器User-Agent做了限流,你看着访问量是0,其实是爬虫被挡在CDN层了。我自己的处理办法是:在robots.txt里明确给GPTBot和ClaudeBot单独开白名单路径,再把缓存插件的“绕过缓存User-Agent”列表里加上所有AI爬虫的UA。
Q: 我已经确认爬虫能访问了,但文心还是搜不到我的招聘页面,下一步查什么
爬虫能来只是第一步,它读不读得懂才是关键。你做的招聘行业,职位页必须要有JobPosting Schema标记,我看了很多Shopify招聘站,要么没加结构化数据,要么加了但格式不对——比如用微格式而不是JSON-LD,或者缺少必填字段如hiringOrganization和jobLocation。文心这类AI搜索引擎在抽取职位信息时,优先读结构化数据,没有它就只能靠HTML正文猜测,概率大幅下降。真的。我建议用Google的Rich Results Test先验证Schema是否通过,然后再到核子GEO的网站对比功能,把你的店铺和同行业一个能被文心收录的竞品站做对比,看差在哪些字段和内容深度上。我用这个方法发现我自己的站缺了salary和validThrough这两个字段,补上后两周内AI引用率从0%涨到了大概12%。
Q: 做了og:tag和twitter:card到底有没有用,值不值得花时间搞
对文心搜索来说,og:tag和twitter:card的直接作用不大——文心不靠社交卡片抓数据。但你问这个问题说明你还没找到核心矛盾。你真正该做的是先解决索引和抓取,再谈内容优化。不过,如果你做的是招聘行业,我建议你顺手加上,因为Google和Bing的AI概览(AIO)会读取og:title和og:description作为摘要候选,而文心目前也在训练对社交信号的权重。我的做法是:用Yoast SEO自动生成og标签,花半小时配置好,不追求完美,但保证每个职位页有独立的og:title和og:description,包含职位名称、城市、薪资范围——这些信息AI引擎会直接拿去生成答案。别在twitter:card上花太多时间,它只影响Twitter展示,对搜索排名几乎零影响。
Q: 我的Shopify店铺内容更新很频繁,AI爬虫每次只抓首页不抓职位详情页,怎么解决
这是典型的“爬虫深度不够”问题,招聘行业尤其明显——职位页每天新增几十个,但AI爬虫预算有限,它优先抓首页和权重高的页面。我测试过,默认情况下GPTBot的抓取深度只到二级页面,你的 /jobs/ 列表页能抓到,但 /jobs/xxx 详情页经常被跳过。解决办法有两个:第一,在首页正文里加文字链接指向最新职位详情页,别用图片按钮或JS跳转,AI爬虫只认href链接;第二,做一个独立的 /sitemap-jobs.xml 只包含职位详情页URL,并在robots.txt里明确指向这个文件。我自己的站把sitemap拆成三个子文件后,职位页的AI抓取率从不到2%涨到了18%左右。另外,不要把旧职位删掉,改成标记为“已关闭”状态,保持URL可访问,AI引擎对死链惩罚很重。
一句话总结
先查AI爬虫访问日志确认抓取入口,再补JobPosting Schema和独立sitemap,兜底一句用核子GEO对比竞品持续迭代,文心收录只是时间问题。