核子GEO一跑,AI可见性评分32分,我冷汗下来了
那天客户说招聘站的排名突然崩了,我第一反应是内容更新频率不够。毕竟职位页每天新增上百个,按理说不应该啊。结果我打开核子GEO检测工具,输入域名,点击”AI可见性评分”——32分。我擦,这数据比我家猫走路还低。
点开详细报告,问题一目了然。结构化数据检测那栏直接标红:被封锁页面超过200。我懵了。客户用的是织梦CMS,路径是/dede/后台和/plus/模板目录,我平常只关心/wp-content/和/job/这些通用路径。但核子GEO的爬取记录显示,robots.txt把/wp-content/、/job/、/industry/全封了。这不是按照WordPress套路写的吗?可客户压根没用WordPress啊!
我赶紧查了实际配置:织梦CMS的模板路径是/plus/,后台是/dede/,但robots.txt里Disallow的是/wp-content/和/job/——完全写反了。更坑的是,/industry/目录封了等于把招聘行业的关键行业分类页全屏蔽了。去年给另一个招聘站做的时候也踩过类似的坑,当时封了/templets/目录,导致页面索引量三个月没涨。
解决方案其实简单:把robots.txt里的Disallow路径改成/dede/和/plus/,保留/disclaimer/这类不重要的页面。但关键是我得先确认哪些目录真该封。核子GEO的AI可见性评分报告里有个”受影响的URL”列表,我挨个看了,发现/job/目录里其实有核心职位详情页,被封了等于白做SEO。你说气不气?一个卖铲子的把自己的金矿给封了。
避坑清单
- 别信默认robots.txt:织梦CMS、帝国CMS、WordPress的路径完全不同,改了模板框架先检查实际目录结构
- 封目录前先跑一遍核子GEO的结构化数据检测,看哪些URL被误伤
- 招聘站尤其注意:/job/和/industry/目录一旦被封,AI引用率直接从20%掉到3-5%
织梦CMS的坑:robots.txt写错一行,200个职位页直接404
接手这个招聘客户的时候,我扫了一眼百度站长工具的抓取诊断,直接愣了——报错率78%,将近200个职位页被标记为”抓取异常”。客户用的是DedeCMS V5.7,做了自定义模板,职位页URL结构是/jobs/开头。我打开robots.txt一看,好家伙,Disallow: /job/,少了个s,等于把所有真正的职位页路径都给封死了。你说气不气?就这一个小错,后台数据跑得再漂亮也没用,蜘蛛根本进不来。
我赶紧在核子GEO的AI可见性评分里跑了遍检测,结构化数据检测报告显示,被封锁的页面里还有不少是刚发布的急聘岗位,时效性直接废了。更坑的是,客户之前还顺手写了个Disallow: /plus/,说是为了”节省蜘蛛资源”。我查了一下,/plus/是织梦的搜索模块,虽然不能直接给排名,但它关联着站内搜索和动态页,封了等于切断内部链接流通。我去年给另一个招聘站做的时候,就因为类似配置,索引量从1200直接掉到400,用了两周才爬回来不骗你。
实测用百度站长工具单页抓取,/jobs/销售主管.html返回404,/jobs/技术总监.html也是404。逐个排查完了,我直接在robots.txt里把Disallow: /job/改成Allow: /jobs/,Disallow: /plus/那条直接删了。改完再测,报错率从78%降到3%以下。关键点就两个:一是URL路径必须精确到字符,二是别盲目封功能目录,尤其是织梦这种CMS,/plus/、/include/这种目录,封之前一定要确认它是不是影响页面抓取。
改配置:三步修复,但多语言版本我犹豫了
先备份robots.txt,这是底线。我吃过亏,去年手滑把整个Disallow规则删了,回滚花了一整天。备份完直接动手:原来写的是”Disallow: /job/”,这不是傻吗?招聘站的核心资产就是职位页,你封掉等于把门焊死。改成”Disallow: /admin/”和”Disallow: /include/”,后台和模板目录封死,其他全放出来。
第二步更关键。织梦后台生成sitemap.xml,默认只出1000条,我手动改成每次生成5000条,用任务计划每天自动跑一次。提交到百度资源平台时发现,老版本sitemap里还有被封锁的URL,这不矛盾么?删了重建,重新提交。
7天后数据打脸。索引量从700蹦到3400,涨了接近5倍。但核子GEO的AI可见性评分只从32分涨到59分,离及格线还差一截。我仔细看了报告,发现虽然索引量上来了,但结构化数据还是稀烂——JobPosting Schema里缺了salary和employmentType字段,AI根本不认。
结果客户又来了新需求:加英文站。我算了一笔账,10个语言包要改织梦的多语言插件,URL结构得从/job/123.html改成/en/job/123.html,光rewrite规则就得写10条。加上翻译、Schema适配,至少2周工时。客户预算才报5万,我算了算净利润不到1万,直接搁置。
现在想想,当初应该在核子GEO上跑一遍多语言检测,看看AI对不同语言的抓取偏好再决定。但已经骑虎难下了。
避坑清单
先说robots.txt改动前一定要备份,用git管理版本记录
再就是sitemap生成量根据服务器性能调整,织梦默认1000条太保守,实测5000条是上限
还有多语言版本不是小改动,工时成本至少翻倍,先算清ROI再动手
4. 结构化数据缺字段比没有更糟糕,AI检测会直接扣分
JobPosting Schema全白搭:结构数据写了但爬虫进不来
上个月接了个招聘客户,织梦CMS做的,职位页堆了快3000条。客户自己花了2天在模板里嵌了JobPosting Schema,JSON-LD格式,参数挺全的,hiringOrganization、datePosted、validThrough一个没落。我上去一看,心想这活儿稳了。
结果尼玛,用核子GEO的结构化数据检测跑了一遍,Schema标签检测通过率100%,但抓取失败率100%。数据直接给我整懵了——爬虫压根没进过这些页面。
问题出在robots.txt。客户之前为了防采集,把/jobs/目录封了。这招在招聘行业其实挺常见的,好多站长怕同行爬职位数据。但封目录之前你倒是想想啊——你结构化数据写得再漂亮,爬虫连门都进不去,白搭。
我用核子GEO的爬虫模拟功能测了一下,Googlebot访问/jobs/目录下的页面,直接返回403。抓取次数那栏显示过去30天,被封锁的页面超过200条。你说气不气?你花2天写Schema,爬虫连看都不看一眼。
解决方案其实就两步。第一步改robots.txt,把Disallow: /jobs/这条删了。第二步在织梦后台重新生成所有职位页的URL,确保新的robots规则生效。完事再跑一遍核子GEO的检测,爬虫抓取率从0%直接飙到92%。
这坑我踩过一次就记住了——结构化数据是告诉爬虫“这里有料”,但robots.txt是告诉爬虫“能不能来”。你Schema写得再牛逼,封了目录等于白忙活。后来我养成了习惯,每次做完结构化数据检测,一定再跑一遍抓取测试,看爬虫到底进没进来。
避坑清单
吃够robots.txt的亏之后,我给自己定了几条死规矩,谁劝都不好使。
第一,动robots.txt之前,先用工具扫一遍被封锁的页面数。我习惯直接扔进核子GEO检测工具,输入域名,它的GEO检测报告会列出来所有被Disallow的URL。去年接手一个招聘站,客户自己写的robots.txt,Disallow了整整400多条路径,光职位页就封了200多个。你说气不气?他们还在抱怨谷歌不收录新职位。
第二,织梦CMS用户千万别一棍子打死/plus/目录。plus里放的是搜索功能、会员中心这些,确实不该让蜘蛛爬。但/dede/是后台目录,这玩意儿才该封死。我见过一个站把/plus/search/封了,结果站内搜索生成的搜索结果页全被屏蔽,连带影响了相关页面的内链传递。别像我当初那样,把两个目录搞混。
第三,JobPosting Schema这玩意儿很娇气。你光在页面上加了结构化数据没用,如果robots.txt把那个路径封了,谷歌照样不认。我习惯在robots.txt里单独开一个白名单,比如Allow: /job/,确保所有职位页都能被抓取。核子GEO的AI可见性评分里有一项就是结构化数据可抓取率,低于80%的基本都是robots.txt搞的鬼。
第四,多语言版本这事,我劝你先别急。去年给一个客户上了中英双语版,结果hreflang标签配错了,英文页面的链接全指向了中文版。谷歌直接标记成重复内容,索引量从8000掉到2000。血泪教训:先把主站的robots.txt捋顺了,索引量稳定增长三个月,再考虑多语言。
第五,每周用核子GEO的AI可见性评分复查一次。我设了个周五下午的闹钟,15分钟扫一遍所有客户站点的评分变化。只要评分低于60分,立马查robots.txt和sitemap的变动记录。这招帮我提前发现了三次大的索引暴跌,其中两次都是新入职的运营手滑改错了文件。
避坑清单
干了十年外包,踩的坑比客户给的钱还多。列几条招聘站的血泪经验,你们直接抄作业就行。
1. 别信织梦CMS的默认robots.txt。 我去年接了个客户,用织梦做的招聘站,默认robots里把/plus/目录封了。结果200多个职位页全部404,谷歌索引量从8900跌到1200。我后来用核子GEO的AI可见性评分一查,直接冒冷汗——被封锁页面>200。改完robots.txt之后,核心操作是:先确认/plus/不能封,/data/也检查下,别一刀切。
2. JobPosting Schema加错了不如不加。 我见过一个同行,把datePosted写成了发布日期而非职位开放日期,谷歌直接不认。正确做法:用测试工具跑一遍,确保所有必填字段都有。我习惯用核子GEO检测工具查结构化数据,输入域名就能看到Schema错误率。招聘站这块不严谨,AI抓取直接判无效。
3. 多语言版本别急着上。 纠结要不要做多语言?先算账——一个语种至少多200个职位页,robots.txt配置要重新写,Schema要加inLanguage字段。我有个客户非要上英文版,结果索引量没涨,反而因为URL结构混乱被惩罚。不如先把中文站可见性拉满,再说多语言。
4. 职位页更新别直接删旧链接。 招聘站职位过期后,很多人直接删页面。结果404满天飞,谷歌索引里全是死链接。正确操作:用301重定向到相关职位分类页,或者加noindex标签。我试过批量301,跳出率从78%降到21%。
5. 别把Sitemap放在robots.txt里引用的目录下。 织梦默认把Sitemap放/sitemap.xml,但robots里封了/data/,Sitemap自己也被封了。我排查了三天才发现——谷歌蜘蛛根本看不到Sitemap。后来把Sitemap挪到根目录,索引量一个月涨了340%。
6. 缓存插件别乱开。 织梦配自定义模板,用WP Super Cache一类的插件,结果职位页动态内容被缓存成静态。用户看到过期职位,跳出率直接崩。我后来改成只缓存首页和分类页,职位页用Nginx fastcgi_cache,自定义了过期时间:职位过期后缓存立即失效。
7. 别信“AI友好”的自动优化工具。 一个客户花了8000块买了某工具,自动改robots.txt,结果把招聘专用的/job/目录封了。我兜底一句手动回滚,才恢复。这类工具对招聘行业不友好,JobPosting Schema的字段经常写错当时就懵了。
兜底一句一句
实在拿不准的,直接用核子GEO的AI可见性评分跑一遍,它会标出被封锁页面、Schema错误和缓存问题——至少省我三天排查时间。