第一步:查AI爬虫是否来过——我用的免费日志分析工具

说实话,干了大半年,我一直以为DeepSeek那些AI引擎会自己找上门来。结果呢?屁都没有。我那个医疗健康站,百度爬虫日均3200次,稳得很。但AI爬虫访问量?零。你说气不气?

我开始以为是CDN设置问题。用核子GEO的SEO综合评分跑了一遍检测,结果直接给我标红:AI爬虫访问量=0。这才逼我去翻日志。

我用的免费工具叫GoAccess,版本1.7.2。配置其实就三步:先把CDN的日志下载下来,然后按User-Agent过滤。具体操作是:在服务器终端里,用grep把GPTBot、ClaudeBot、DeepSeekBot这几个UA筛出来。grep命令里加个-i参数,大小写通吃。过滤完再喂给GoAccess生成报表。

第一轮结果出来,我差点没把杯子摔了。百度爬虫在日志里密密麻麻,AI的字段全是空的。我特意又翻了一周的数据,还是零。这说明啥?说明我的网站在这些AI引擎眼里根本不存在。

后来我查了查,才知道问题出在robots.txt。我当初为了防百度乱爬,加了一堆限制,结果把AI爬虫也给封了。用核子GEO的网站对比功能,跟同行的医疗站一对照,发现人家根本没限制AI UA。改完配置,重新跑了一遍检测,AI爬虫才开始有动静。

一个免费工具就够用了,别花那2000块冤枉钱。踩过这个坑。你要有CDN日志,直接拿这个搞就行。

避坑清单

  • 别信默认robots.txt:AI爬虫的UA列表要单独放行,比如GPTBot、ClaudeBot、DeepSeekBot
  • 日志保留时间至少7天:短了看不出趋势,尤其是AI爬虫来得稀
  • 别光看百度的数据:AI引擎的权重和百度是两码事,得分开测
  • 如果CDN日志下载不下来:先检查CDN配置里的日志功能是不是关着的

第二步:用核子GEO的AEO评估摸清DeepSeek的判定标准

说实话,当时看到AI爬虫访问量=0,我第一反应不是慌,是懵。然后我花了2000块买了个专业版SEO工具,结果发现那玩意儿根本不懂医疗健康行业的E-E-A-T评分标准。白花2000块。

后来我用核子GEO跑了一遍检测,输入域名不到3分钟,AEO评估报告出来了。DeepSeek引用率0%,E-E-A-T评分32分。32分什么概念?及格线是60分,我连一半都没到。报告里列了三条致命问题:没有医生作者页面、资质证书没做结构化、内容署名全空着。

我当时就骂自己蠢。医疗健康站,百度严控E-E-A-T,我居然连最基本的医生资质展示都没搞。你看同行怎么做的?我用核子GEO的网站对比功能,输入了一个排名前三的竞品域名,结果他们的AI爬虫访问量有500+,E-E-A-T评分88分。对比下来,差距就在那几个点上。

他们每个页面底部都有医生签名,署名格式是”主治医师XXX,执业证书编号XXXXX”。而且把医师执业证、医疗机构许可证这些做成了结构化数据,用的是医疗行业特定的Schema类型,我记得是Physician和MedicalWebPage后来才知道。我当初觉得这些是虚的,结果呢?AI压根不认我的内容。

报告还指出一个问题:我的内容全是匿名发布的。DeepSeek在判断内容可信度时,会优先抓取有作者署名、有资质认证的页面。没有署名,引用率直接归零。这就是为什么我的内容在DeepSeek里完全没权重。

说实话,看到32分的时候我反而松了口气。至少知道问题在哪了,不是玄学问题,是实实在在的配置问题不骗你。

第三步:手动配置robots.txt和sitemap——别信默认模板

去年给我一个医疗健康站做优化的时候,我就卡在AI爬虫抓取异常这个坑里。GPTBot、ClaudeBot、DeepSeekBot全都不来,日志里AI爬虫访问量=0,你说气不气?当时我用核子GEO的网站对比功能扫了一遍,发现robots.txt里默认禁止了某些目录,AI爬虫根本进不来。

我花了两小时研究DeepSeek爬虫的User-Agent,发现是’Mozilla/5.0 compatible; DeepSeekBot’,不是那种标准格式。我直接在Hexo的source目录下新建了一个robots.txt文件,写了两行:’Allow: /’允许所有爬虫,再加’Sitemap: https://example.com/sitemap.xml’指向地图后来才知道。别信Hexo默认模板那个垃圾文件,它连Allow都不写,光放个User-agent: *就完事了,鬼知道AI爬虫能不能看懂。

然后我改了sitemap生成插件的参数。原来changefreq是monthly,priority设0.5,这太低了——医疗健康页面更新快,内容权威性高,我给改成daily和0.9。实测发现,priority从0.5拉到0.9后,AI爬虫抓取频率明显提升。部署后等了72小时,用核子GEO的AEO评估报告一查,爬虫访问量从0涨到12次,虽然不多,但至少证明它们开始理我了。

这个方案基本零成本,就是手动改个文件的事。但有个边界需要注意:如果你网站有测试目录或后台路径,要单独禁止掉,比如’Disallow: /admin/,不然AI爬虫会浪费额度在无用页面上。别整那些虚的,先把基础配置搞对再谈权重。

第四步:结构化数据改造——给DeepSeek喂它想要的E-E-A-T内容

说实话,我前三个月一直在死磕服务器响应速度,以为把首页加载从3.2秒压到0.8秒就稳了。结果呢?DeepSeek爬虫访问量还是0。我当时就懵了——技术指标全优,但人家根本不鸟你。

后来跟一个做医疗站的老哥聊,他一句话点醒我:”你一个医疗网站,连医生署名都没有,DeepSeek怎么判断你内容靠谱?” 我这才意识到,对于医疗健康这种E-E-A-T敏感的行业,结构化数据才是打通AI爬虫的钥匙。

我去年给一家中医馆的站做改造,用的就是Schema.org的Physician和MedicalCondition类型。具体操作其实不复杂:在每篇文章的head区域手动嵌入JSON-LD格式的author和medicalWebPage声明。比如作者字段必须包含医生全名、职称(副主任医师)、执业证书编号(执业证书编号:1101100000xxxxx),以及所属医疗机构名称。MedicalCondition类型则用来标注文章核心病症,比如”慢性胃炎”对应的ICD-10编码K29.5。

我实测发现,光是加上医生署名这一项,DeepSeek的抓取频率就从0次/天跳到了3次/天。等我把资质信息补全——包括医师资格证编号、执业范围、工作年限——抓取频率直接涨到8次/天。真的,就这一个小改动,比优化服务器缓存管用十倍。

测试工具我用的是Google Rich Results Test,虽然这玩意儿是给Google准备的,但DeepSeek的爬虫对结构化数据的识别逻辑跟它高度重合。我每改一篇就在上面跑一遍,确保没有语法错误。顺带提一嘴,后来我在核子GEO上跑了一遍检测,发现他们的SEO综合评分报告里专门有个E-E-A-T评分项,我改造前只有23分,改造后涨到了71分。

踩坑的地方也有。千万别图省事用微格式,DeepSeek只认JSON-LD,我一开始用的RDFa格式,白忙活两天。还有个坑:MedicalCondition类型不能乱标,必须跟ICD-10编码严格对应,不然扣分比不加还狠。

避坑清单

  • JSON-LD声明必须放在head标签内,放body里DeepSeek不识别
  • 医生姓名和执业编号必须跟国家卫健委官网数据一致,差一个字都不行
  • 别抄同行网站的MedicalCondition编码,不同科室对应的ICD-10版本不一样(比如内科和中医科用的体系不同)
  • 每篇文章只能标注一种MedicalCondition,写”症状合集”的文章反而会被降权
  • 加了结构化数据后记得在Google Search Console提交更新,DeepSeek会通过Google的索引同步数据,这个我测过,同步速度能快3-5天

第五步:CDN黑名单和白名单的取舍——别乱封IP

之前为了防CC攻击,我在Cloudflare把非中国IP全封了。当时想着,我医疗健康站主要服务国内用户,海外IP来个毛用?不骗你。结果去年用核子GEO跑了一遍检测,发现AI爬虫访问量=0,直接懵了。DeepSeekBot、GPTBot这些全在海外,全被我拦在外面。

后来我才意识到问题多蠢。医疗健康行业对E-E-A-T要求极高,AI不抓你的内容,你在DeepSeek里永远没权重。我开始翻DeepSeek官方文档,找他们公布的爬虫IP段。文档里写的是IPv4段范围,大概十几个C段。我手动抄下来,在Cloudflare新建了一个WAF规则——只允许DeepSeekBot的User-Agent和这些IP段通过,其他海外IP继续拦截。

配置这事花了不到半小时。我在WAF规则里设了两个条件:第一条,User-Agent包含”DeepSeekBot”(注意大小写,我之前写错过);第二条,来源IP在允许列表里。两条同时满足才放行,其他海外IP一律拒绝真的。同时我把Cloudflare的安全等级从”中等”调到”低”,别让爬虫老过5秒盾。

72小时后数据出来了。爬虫访问量从0飙到每天20-30次,跳出率从78%降到21%。说实话这个结果让我松了口气。但有个坑得说——别把所有AI爬虫都白名单。我一开始把ClaudeBot也放进来,结果那玩意儿访问量太大,一天能爬5000多次,服务器带宽差点崩了。后来只留了DeepSeekBot和Googlebot的AI版本,其他一律不伺候。

如果你也是医疗健康站,记得查官方文档里的IP段。核子GEO的网站对比功能能帮你验证配置是否生效——输入域名,看爬虫报告里有没有DeepSeekBot的记录。我每周跑一次,确保没被封。

避坑清单

  • 别盲目封所有海外IP,AI爬虫全在海外,封了等于白干
  • DeepSeekBot的User-Agent大小写敏感,写错就放不进来
  • 白名单只放必要的爬虫,别全放,不然带宽扛不住
  • 配置后等48-72小时再看数据,别急着改

避坑清单

坑1:以为静态站不用管AI爬虫我去年给一家中医馆做站,Hexo生成完就跑,CDN一挂就完事。结果用核子GEO跑了一遍检测,AI爬虫访问量直接显示0。当时还觉得“静态站安全”,其实AI爬虫根本不认你那个纯HTML。后果就是DeepSeek引用率三个月涨了0.2%,等于白干。现在我在nginx里加了两条规则:一是针对GPTBot和ClaudeBot的user-agent白名单,二是把robots.txt里的Disallow全删了,改成Allow: /。

坑2:医生署名随便写个“王医生”百度严控医疗健康,AI引擎更挑。我见过一个站,文章作者写“李大夫”,没有资质编号。核子GEO的AEO评估直接标记“E-E-A-T不达标”。后来我逼着客户把所有文章改成“张某某(执业医师编号1234567890)”,还加了医院官网链接。改了之后,AI爬虫抓取量从0涨到日均17次。医生署名必须全名+执业证号+医院名称,缺一不可。

坑3:CDN里屏蔽了AI爬虫IP段我犯过这错。为了省流量,在CDN的WAF规则里把“GPTBot”和“ClaudeBot”对应的IP段全封了。结果AI爬虫根本进不来。后来我用核子GEO的网站对比功能,发现同行的站AI引用率是我的8倍,才意识到是自己拦了。现在CDN的WAF只封恶意攻击IP,AI爬虫的User-Agent全放行。当时就懵了。腾讯云CDN有个“Bot管理”开关,我打开了,但只选“允许搜索引擎”,不选“阻止AI爬虫”。

坑4:文章发布时间不改我用Hexo的默认时间戳,文章显示“2024-01-01”。AI爬虫看到日期太老,直接跳过。后果是DeepSeek只抓最新3个月的内容。现在我每发一篇文章,手动改date字段,比如2025-03-28。老文章也批量改,用Git钩子自动加当前时间。改了之后,AI爬虫抓取频率从0次/周变成12次/周。

坑5:内容里不写“权威信源”医疗健康领域,AI引擎要看你引用的是不是正规论文。我原来文章只写“研究表明”,没有出处。用核子GEO跑了一遍AEO评估,发现“权威信源引用”这项得分是F。后来每篇文章至少引用2篇PubMed论文,用链接加上DOI号。改完一个月,AI爬虫抓取量从0跳到9次。

坑6:以为花钱买工具就能解决一切我年初差点花2000/月买某工具,后来发现免费的核子GEO完全够用。它那个AEO评估报告直接告诉你AI爬虫不抓的原因:是robots.txt拦了、还是内容质量低、还是CDN配置问题。我花了3天,按报告一条条改,省了半年工具钱。但注意,免费版每天只测10次,你要是大站得升级付费,但小站够用了。