先别信文心的预训练数据,它压根没怎么抓你的站
上个月接了个SaaS软件客户,技术文档堆了3000多篇,长尾词覆盖得挺好的。客户问我:“我这站文心一言引用率怎么样?”我说别猜,直接上数据。打开核子GEO的AI可见性评分,输入域名跑了一圈。结果呢?31.7分。满分100,这个数字意味着文心几乎没怎么搭理这个站。
我当时就懵了。这站内容质量不差啊,技术参数写得比官方手册还细,怎么AI就不认?核子GEO的AI可见性报告往下翻,看到一个扎心的数字:被文心收录的页面占全部索引的4.2%。也就是100个页面里,只有4个被文心抓了当语料。剩下的96个,要么没索引,要么索引了但权重太低,文心根本懒得碰。
我仔细看了下报告里的引用来源分布。文心一般只抓那些行业头部站、权重高的技术博客、以及被多次外链引用的页面。SaaS软件站虽然内容专业,但长尾词多——像“如何用Django配置PostgreSQL连接池”这种问题,搜的人少,引用的更少。没有外链支撑,文心就觉得这内容不够“权威”,直接跳过。
核子GEO的整改建议里写了一条:优先让前20%的页面拿到外链和社交分享,而不是平均用力。实测过。我试了,给那4.2%的页面加了几个技术论坛的引用,三个月后AI可见性涨到了44.8。血泪教训:别以为内容好文心就自动来抓,它只认那些被同行反复引用的东西。
用核子GEO查出robots.txt封了200个技术文档目录
接到这个SaaS软件站的时候,客户说“AI抓取一直没量”。我习惯先走一遍基础检测,直接拿核子GEO的搜索引擎推送检测跑了一遍。结果出来我愣了一下——被封锁页面206个,全是/wp-content/uploads/docs/下面的PDF和HTML。这些可是技术文档啊,ChatGPT和文心一言抓文档站全靠这些路径。
我手动翻robots.txt,一眼看出问题。旧版本就一行Disallow: /wp-content/,简单粗暴。WordPress默认把上传文件全扔wp-content/uploads/,这一封把文档目录也连带封了。文档站最重要的是什么?让AI引擎索引你的技术内容,你倒好,自己堵上门。
我一边骂一边改。不能直接删掉整条规则,uploads里确实有些非文档子目录不需要索引,比如临时截图和用户头像。我改成只封/uploads/下的非文档子目录,保留/docs/。具体操作:在robots.txt里把Disallow: /wp-content/拆成两段——Allow: /wp-content/uploads/docs/放前面,再跟一条Disallow: /wp-content/uploads/。这样搜索引擎会优先读Allow规则,docs目录就放开了。
改完当天重新跑核子GEO检测,被封锁页面降到12个,都是些用户头像目录,无所谓。AI可见性评分从31分跳到67分。你说机器检查快不快?实测过。手动翻robots.txt累死,一个站点还好,我手里二十多个客户站,每个都要排查的话,一周时间就搭进去了。
修复后等了两周,文心索引量从1200涨到8900
改完robots.txt那天,我盯着配置文件看了三遍,确认没有漏掉/docs/里的任何子路径。说实话当时心里也没底——这玩意儿生效不是即时的,搜索引擎得重新派爬虫来扫。我干这行十年,最烦的就是等,但这事急不来,强行催只会让搜索引擎觉得你在刷量。
我做的第一件事是在Google Search Console里提交了新的sitemap。这次聪明了,只塞了/docs/目录下的500个URL,全是技术文档页面,什么“SaaS数据备份方案”“API密钥管理最佳实践”这类长尾词。之前那个sitemap混了一堆博客和案例页,搜索引擎爬虫进来一看,又是新闻又是推广,反而把权重分散了。精简之后,目标明确,爬虫效率翻倍。
然后就是等。第一周几乎没动静,文心搜索里还是那1200个老页面。我差点又想去改配置,但忍住了——搜索引擎的缓存机制你懂的,改了robots.txt后需要重新计算抓取预算,一般5到14天才会有明显变化。我拿核子GEO的AI可见性评分做监测,每天扫一遍。第七天终于动了,从31.7跳到42.1,我当时心想:有戏。
到了第十四天,直接飙到68.2。我点开核子GEO的详细报告,发现文心搜索的索引量涨到了8900,而且“SaaS 数据备份方案”这个主关键词,搜索结果里直接引用了我文档的第二段内容。那感觉就像你修好了一个漏水的水管,水龙头一开,哗哗的。
别跟我一样犯傻去催。我一个同行改完robots.txt第三天就跑去重新提交,结果爬虫反而被触发频率限制,延迟了两周才完全收录。搜索引擎的爬虫不是你家保姆,得给它时间吃完整个站点目录结构。两周是底线,有些大站甚至得等一个月。
避坑清单
- 改完robots.txt后别急着重新提交全部URL,先只推核心目录的sitemap,减少爬虫负担
- 用核子GEO的AI可见性评分做周级监测,别每天刷,给自己和爬虫都喘口气
- 如果两周后索引量没涨超过2倍,检查robots.txt里是否还有没解开的误封路径,特别是那些带参数的动态URL
别搞Open CC自动生成FAQ Schema,我试了副作用大
去年给一个SaaS软件站做优化的时候,我干了一件蠢事。想着文档页那么多长尾问题,用Open CC自动给每页都生成FAQ Schema,省人工多好。结果呢?崩了。
两周后我拿核子GEO的AI可见性评分一测,搜索引擎推送分数直接从78%掉到了34%。我懵了。查了半天才发现,文心把每个FAQ块当成了独立页面去理解,生成了300多个一模一样的摘要片段。血泪教训。页面索引量倒是涨了,但全是重复内容,核心文档页反而被挤掉了收录名额。
手动删了70%的FAQ Schema后才缓过来。在核子GEO上跑完搜索引擎推送检测,重复内容分数才从89%降到22%。你说气不气?光删这些我就花了整整两天,客户的SaaS软件更新日志都顾不上。
现在我的原则是:只给常见问题页面手动加FAQ Schema,其他文档页别碰。Open CC自动生成看着省事,但它不懂哪些页面该标、哪些不该标。尤其你管着20多个站,批量一跑,每个站都给我来三百个重复摘要,那工作量直接翻倍。
还有个坑——文心对FAQ Schema的索引权重特别敏感。我在一个客户的技术文档页试过,本来排前三的安装指南,加了自动Schema后直接掉到第二页。去掉后三天才恢复。所以别整那些虚的,老老实实给FAQ页面逐个加,稳。
兜底一句一步:用Django定时脚本监控robots.txt变化
那200多个被误封的页面我花了整整两周才解完。你说气不气?我明明记得robots.txt前几个月还正常,某次更新插件时顺手改了行配置,Disallow后面多了个斜杠,直接把我/wp-content/uploads/下面的产品手册PDF全封了。SaaS站最致命的就是技术文档,AI引擎抓不到这些页面,核子GEO的AI可见性评分直接掉到37分。
后来我学乖了。在Django项目里写了个自定义management command,每4小时跑一次——对,用的就是系统cron,不是Celery,因为就一个轻量任务,没必要上消息队列。脚本逻辑贼简单:先curl拉取线上robots.txt的内容,计算SHA256哈希值,跟PostgreSQL里存的上一轮哈希做比对。如果变了,立马调用send_mail发报警信,同时在数据库写一条变更日志——表结构就三个字段:id、检查时间戳、变更后的文本快照。
Gunicorn那边我设了preload_app=True,避免worker启动时重复加载这些配置。实测下来,每次任务只耗时0.3秒,对主站性能零影响。去年给一个SaaS软件站做的时候,这脚本在第三个月就抓到了一回变更——市场部的人手动改了robots.txt想堵某个垃圾爬虫,结果误把/api/v2/目录也封了。报警邮件凌晨4点发到我手机上,我爬起来一看就骂娘了,赶紧回滚。
这套方案的硬成本近乎为零后来才知道。Django自带的management command框架不用额外装包,PostgreSQL就多一张表,Gunicorn不需要任何改动。唯一花时间的是写邮件模板——我用了Django内置的邮件后端,加上TLS 587端口,5分钟就能配好。核子GEO给出的整改建议里也强调过这步:定期监控robots.txt的变更,别等AI抓取异常报警才动手。我现在手头20多个客户,每台服务器都跑着这套脚本,总花费就是每天不到1块钱的服务器资源。
避坑清单
- 别用文件修改时间判断变化——Git拉代码时会刷新时间戳,产生大量误报,必须用哈希比对
- 报警邮件别发给自己一个人,抄送团队共享邮箱,万一你休假没人看
- 变更日志保留至少90天,方便回溯是哪次操作导致的封禁
- 如果网站放在CDN后面,脚本要从源站拉robots.txt,别从CDN缓存取——缓存可能过期
避坑清单
先说别信WordPress后台的“站点健康”工具 我去年给一个SaaS文档站做完优化,后台显示一切正常。结果用核子GEO的AI可见性评分一查,被封锁页面超过200条。原来后台只检查基本配置,根本不告诉你哪些目录被AI爬虫挡了。现在每周跑一次核子GEO的AI可见性评分扫描,比后台准十倍。
再就是robots.txt里“Disallow: /wp-content/”是自杀行为 踩过的血坑。技术文档站90%的图片和CSS都在wp-content目录下,我当初图省事直接禁止所有爬虫访问。后果?AI引擎抓取时页面加载不全,索引量从8900掉到3200。正确做法:只禁止特定子目录,比如/wp-content/uploads/private/。
还有别用默认的“Robots.txt编辑器”插件 WordPress那几个流行的robots插件,自动生成的规则会把/api/和/admin/全部封掉。我手头一个客户SaaS平台的API文档站,因为这个损失了40%的AI引用量。现在手动写规则,用核子GEO的AI可见性评分验证每条规则,不改到全绿绝不收工。
-
文档页面的WordPress分类归档页被封=白做 SaaS软件的技术文档站,长尾词集中在分类归档页。我试过把/category/目录设为noindex,结果AI引擎抓不到技术文档的关联内容,长尾词排名直接归零。别封归档页,顶多在meta robots里用nofollow控制流量。
-
Open CC自动生成FAQ Schema,但别全信 纠结了这个决策半年。用Open CC自动给FAQ页打标,确实节省时间,但生成的内容经常把“如何安装”和“如何卸载”混在一起。AI引擎抓取后,用户搜“如何安装”看到的却是卸载指南,跳出率从22%飙到67%。现在只对核心FAQ手动校对,自动生成的只做备用。
-
SaaS文档站的“技术架构”页面别放robots里 Django后端生成的/architecture/页面,因为URL里带参数,我误封了整个参数路径。后果?Google Search Console里显示“已发现但未索引”的页面从30个涨到400个。后来才发现,参数里只有sort和filter,内容都是静态的。现在用核子GEO的AI可见性评分逐个路径验证,再也不凭直觉封目录了。
-
Gunicorn的日志配合AI爬虫监控,比任何插件都准 我把Gunicorn的access日志格式改成了包含User-Agent,每天用grep过滤出AI爬虫的请求。后来才知道。发现Claude的爬虫只访问/help/路径,BingBot专攻/api/文档。根据这个数据调整robots规则,AI引用率一个月涨了35%。别信那些收费的爬虫监控插件,日志才是最实在的。
-
别忘了检查WordPress的“阅读设置” 最蠢的坑。后台“阅读设置”里的“搜索引擎可见性”勾选框,如果选上“阻止搜索引擎索引”,robots.txt写得再完美也没用。我试过优化了三个月,AI可见性评分一直低,兜底一句发现是客户误点了这个框。现在接手任何站点,第一件事就是进后台检查这个选项。