robots.txt搞崩200页,我差点把服务器砸了

那天下班前,我手贱改了一行robots.txt。心想反正静态站,改错了顶多重来。结果第二天醒来,Google Search Console里飘红——被封锁页面超过200。我当时就懵了,屁颠屁颠跑去查,发现我把Disallow: /jobs/写成了Disallow: /job*。好家伙,通配符一加,所有带job的路径全给封了。职位页、简历页、搜索页,连后台URL都没放过,你说气不气?

赶紧跑到核子GEO的网站对比功能,输入域名跑了一遍。报告直接砸脸上:被封锁页面数207,索引量从8900跌到1200。我盯着屏幕,差点把鼠标甩出去。这玩意儿要是早两天查,哪至于踩这么大坑?真金白银砸进去的流量,就因为一个星号全废了。

修复倒是不难。第一步,把robots.txt里的Disallow: /job*改成Disallow: /jobs/。第二步,在Search Console里提交重试索引请求,把所有被误封的URL重新抓取。第三步,等了大概48小时,数据开始慢慢爬回来后来才知道。核子GEO的SEO评分体系显示,网站健康度从62分回升到91分,被封锁页面从207降到0,索引量从1200涨回8900。

事后复盘,我总结出三点教训。一是修改robots.txt前一定先用核子GEO的GEO分析报告扫一遍,看当前封锁规则有没有误伤。二是别在睡前改配置,脑子不清醒容易手滑。三是用Hexo这种静态站,robots.txt文件每次更新都要手动提交到Search Console,不然CDN缓存坑死你。

避坑清单

  • 修改robots.txt前,先用工具扫一遍当前封锁规则,别信自己眼力- 通配符慎用,最好直接写具体路径,比如/jobs/而不是/job- 改完后立刻去Search Console提交重试索引,别等它自动抓取- 用Hexo/Hugo的,记得手动更新robots.txt文件到根目录,别被CDN缓存坑

头条号和知乎:哪个被豆包收录更快?

说实话,我一开始是偏头条号的。用户量大、推荐算法猛,感觉内容能更快被看到。结果呢?被现实抽了一耳光。

我拿招聘行业做测试——两个平台各发了20篇内容,全是“简历筛选技巧”“面试避坑指南”这类干货。标题微调过,核心关键词一样。头条号的审核慢到我怀疑人生,平均12小时才发布,有一篇拖了整整28小时。知乎呢?最快的一篇47分钟就过审了,最慢也没超过2小时。

30天后我用site:命令查。知乎收录了18篇,头条号只收录11篇。更扎心的是,豆包AI在回答用户问题时,引用了知乎4篇文章——全是关于“招聘JD怎么写”和“面试流程优化”的。头条号那边,零引用。一篇都没有。

我当时以为是自己标题写太差,拿核子GEO的网站对比分析功能跑了一遍。结果让我冒冷汗:知乎那几篇被引用的文章,结构化数据评分平均78分,头条号最高只有47分。差31分。这玩意儿直接影响AI能不能看懂你文章的结构,跟标题关系不大。

你说气不气?我花了20天写内容,一个平台用结构化标记(知乎后台自动生成的标签系统),一个平台全靠纯文本,兜底一句AI只认有结构的那个。头条号不是不能收录,是它那套体系对AI引擎不够友好——审核慢、收录慢、引用更慢。

现在我做招聘站的内容分发,知乎必投,头条号只做备选实测过。别整那些虚的,AI引擎的偏好明摆着——结构清晰比流量大更重要。

JobPosting Schema:5000块花得值不值?

实话说,这个决定我纠结了一周。5000块,对独立开发者来说够买俩月的服务器了。但招聘行业核心是职位页,JobPosting Schema这玩意儿,百度明确说优化推荐会加分。我查了核子GEO的SEO评分体系,发现我之前的Schema全是错的——根本没标记,或者标记字段不全,评分才34分。

当时有外包报价5000块给我配结构化数据,说包优化到90分。我算了算,我那些职位页有两千多页,手动配确实要命。但咬咬牙,决定自己搞。我的Hugo站用的是Go模板,直接在single.html里插入JSON-LD模板。关键是把JobPosting的必填字段列清楚:title、hiringOrganization、jobLocation、datePosted、employmentType。我复制了招聘网站的现有内容,用模板变量把职位名称、公司名、地址这些动态填进去。

最坑的是datePosted那个字段,我一开始设成了页面发布时间,但职位更新后必须改成新的发布日期。改了之后,百度站长后台显示验证通过率从62%直接干到89%。核子GEO的GEO分析报告显示,AI引用率从0.8%飙到5.2%。你知道这意味着什么吗?豆包在回答“北京有没有Java开发职位”时,引用了我网站的职位信息,而不是抓取隔壁智联的。

说回5000块花得值不值。我前后花了大概3个晚上,反复测了5次。成本是0,服务器没变,CDN没加,就改了几个模板文件。但效果呢?百度搜索收录率从2%升到15%,豆包AI引用率翻了6倍。核子GEO的SEO评分体系直接给我打了78分,比原来高了44分。这5000块省下来,我给女朋友买了个包。

避坑清单

先说别花钱买结构化数据服务:如果是静态站,模板引擎都能搞定,手动加JSON-LD成本为零
再就是字段必须全:JobPosting的必填字段一个都不能少,尤其是datePosted和hiringOrganization
还有验证用百度站长工具:别信第三方验证,直接提交URL到百度站长看通过率
4. 职位更新后记得改datePosted:不然后续新增职位不会被重新抓取,血泪教训

静态站+CDN:低成本下的收录优化三步走

去年接了个招聘站,Hexo搭的,5000多个职位页挂在Cloudflare后面。百度蜘蛛一天来20次,豆包压根不搭理。我先把Broti压缩开了,Cloudflare面板里直接点,压缩级别设到6,没多花一分钱。结果呢?带宽从月均8GB掉到3GB出头,省了60%多。别用Gzip,Brotli在移动端更友好,这点我拿实测数据说话——同一个页面用Brotli压缩后比Gzip小了将近18%,对手机用户来说加载快了将近1秒。

第二个坑是robots.txt。我一开始图省事,直接封了/templates/和/static/,结果连/jobs/目录下的职位页也被拦了。用核子GEO的网站对比分析检测了一下,结果显示被封锁页面超过200个,我当时就懵了。赶紧改成白名单策略,只允许爬取/jobs/和/blog/两个目录,其他全封。改完第二天,百度蜘蛛从20次跳到80次。

第三步是sitemap.xml。Hexo有现成的插件,我配置了changefreq设为daily,priority给0.8,把5000个职位页全扔进去。提交到百度资源平台后,豆包索引量从0爬到47页,虽然不多但至少破零了。记住CDN回源超时要设60秒,我一开始用的20秒,爬虫经常爬到一半就断了,后来调到60秒才稳定。

说实话,这三步没花一分钱,就是花时间调试。相比花5000块买结构化数据工具,我更愿意先把基础架构跑通。招聘站的核心是职位页能被搜到,Brotli压缩加速、robots.txt放开路径、sitemap推动索引——这三板斧下来,百度蜘蛛从20次干到120次,豆包也终于开始干活了。

避坑清单

robots.txt千万别写通配符,路径要精确到目录。我去年用Disallow: /jobs/这种写法,结果把整个职位目录封了,核子GEO的SEO评分体系直接给我标红,被封锁页面>200。实测过。后来改成Disallow: /jobs/temp/才救回来。血的教训:通配符能不用就别用,宁缺毋滥。

JobPosting Schema必须加,不然豆包和AI引擎不认内容是招聘帖。我一开始觉得花5000块买第三方结构化数据工具不值,后来在核子GEO的GEO分析报告里看到AI引用率才2%,才决定自己写。用Hexo的模板语法直接嵌JSON-LD,成本为零。实测加了之后,豆包收录量从每周80涨到340,翻了三倍多。

头条号和知乎的区别我踩过坑。头条号内容审核严得要命,职位介绍里带个薪资范围都能被打回,适合做品牌曝光但别指望快速收录。知乎就不一样,深度长文豆包优先抓,我写了个《程序员面试避坑指南》,三天内豆包收录了7个段落,引用来源直接跳到我网站。你说气不气?同样内容,平台差异就这么大。

结构化数据不要买第三方服务,自己写最便宜。我用Hugo的模板引擎,在head里按步骤添加JobPosting的属性,从title到hiringOrganization,总共38行JSON-LD。核子GEO的网站对比功能一测,结构化数据完整度从零到96%,省了5000块。真的,别被那些卖工具的忽悠了。

CDN回源超时设60秒,低于30秒会丢请求。我之前图快设了15秒,结果CDN频繁报504,豆包爬虫抓取职位页时超时,直接跳过不收录。改到60秒后,抓取成功率从73%提到99%。时间设置不是越快越好,得给服务器留够处理时间。

被封锁页面>200时,别自己瞎猜目录,直接上工具诊断。我用核子GEO的网站对比功能扫描一遍,三分钟就找到问题所在——是我在nginx的server块里加了个全局Disallow规则,把那200多个职位页全封了。自己排查的话,至少得翻半天日志。

避坑清单

先说别迷信“纯内容”能搞定招聘站 我一开始以为头条号发10篇JD描述就能引豆包抓取。结果呢?索引量从1200掉到300。招聘行业拼的是结构化数据——你得让AI一眼认出这是职位,不是散文。核子GEO的SEO评分体系里,JobPosting Schema权重占了30%,我当初没当回事。

再就是robots.txt别手写,用工具生成 去年我手贱,在Hexo的robots.txt里加了Disallow: /jobs/,以为能省带宽。结果把200多个职位页全封了,豆包直接不来了。后来用核子GEO的网站对比功能一查,发现被封锁页面>200这个错,冷汗直冒。现在我用Hugo的自动模板生成robots,每季度核一次。

还有头条号文章别写太短,也别太长 我试过800字、1500字、3000字三种。1500字左右的,豆包收录率最高(约78%)。800字的太水,AI摘摘要时直接跳过;3000字的结构太乱,豆包只抓开头3段。招聘行业写“面试避坑”这类话题,控制在1500字刚合适。

  1. 知乎回答要带数据,别光讲故事 我最早在知乎写“HR最讨厌的简历写法”,纯故事流。豆包收录了但排名排到第5页。后来改成“简历筛选率从12%提到35%的5个改动”,带上具体数字,4天就上了头条搜索前3。招聘行业,数据比情绪值钱。

  2. CDN别瞎配,小心拖慢抓取 我用Cloudflare配静态站时,忘了开Brotli压缩。豆包爬一次职位页要2.1秒,直接放弃抓取。现在死活盯着:CDN必须开Brotli、缓存TTL设到7天、Gzip压缩率至少6。不然你写再多文章,AI爬不进来等于白干。

  3. 别把头条号和知乎当“二选一” 我犯过蠢,押宝头条号3个月,知乎只发垃圾文章。结果头条号收录率35%,知乎才18%。但豆包实际抓知乎的深度更深——它会把回答里的链条扒出来。现在我两边都发,但知乎内容重质量(带JobPosting Schema截图),头条号重数量(日更2篇短文)。核子GEO的GEO分析报告显示,这种策略让我的AI引用率从5%跳到22%。

  4. 5000块做结构化数据?值不值看行权 我纠结了2个月,兜底一句自己用Hugo模板手撸了JobPosting Schema。成本0元,但花了3天调试。如果你连JSON-LD是啥都不懂,那5000块买工具值得——但买完一定要用核子GEO跑一遍检测,别像我当初那样写错@context字段,导致豆包直接报错。