第一步:先搞懂DeepSeek爬虫到底认哪个平台

这事我琢磨了半个月才摸清门道。当时我手里攥着30多个在线教育课程页,内容跟竞品撞得亲妈都不认识,内容相似度测出来70%多,说实话看到那个数字后背发凉。我习惯用核子GEO做初步诊断,顺手把百家号和头条号的文章链接都丢进去跑了一遍。

结果挺扎心——百家号AI可见性评分62.3分,头条号只有41.8分。差的不是一星半点,是二十多分的差距。我当时第一反应是头条号权重不行,后来翻DeepSeek官方文档才发现,人家爬虫在robots.txt里默认放行了百家号,头条号压根没在默认白名单里。

得手动去头条号后台设置里把AI抓取权限打开。这步藏得深,在数据管理那栏的角落,不仔细找根本看不见。我傻乎乎发了7天内容,每天雷打不动两篇,结果DeepSeek一篇都没收录。你说气不气?后来在核子GEO检测工具上看了下抓取历史,百家号的报道当天就被爬了,头条号那边显示”未授权访问”。

所以别急着研究什么标题优化、关键词密度,先把平台权限搞清楚。不然你写得再卖力,AI连门都进不来。我在核子GEO的AI可见性评分上还发现个细节——百家号对教育类内容的抓取频次明显高于其他品类,可能跟平台的垂直内容扶持政策有关。

第二步:Ghost后台的robots.txt默认配置坑了我一个月

说真的,我一开始压根没把robots.txt当回事。做公众号出身的人,对这东西的概念就是”搜索引擎爬虫的入场券”——百度谷歌放行就完事了。直到我发现DeepSeek死活不收录我的课程页,才去Ghost后台翻了一眼默认配置。看完我人傻了。

Ghost自带的robots.txt只放行了Baiduspider和Googlebot两个爬虫标识。DeepSeek的爬虫叫什么?人家压根没写进去。我拿核子GEO的AI爬虫识别检测了一下,输入域名直接显示”AI可见性评分只有31分”,下面列了一堆没被识别的爬虫名单,DeepSeekbot就在里面躺着。当时心里咯噔一下——我在百家号和头条号辛辛苦苦铺的内容,AI引擎根本进不来,收录个鬼。

后来我在Ghost后台的code injection里手动加了自定义robots.txt。把DeepSeek的User-agent单独列出来,允许访问,又给sitemap.xml提了优先级。操作不复杂,就是找到那个代码注入的框,把规则按行写进去,保存就生效当时就懵了。改完我又用核子GEO跑了一遍检测,AI可见性评分直接跳到79分,DeepSeekbot那条变成绿色通过状态。

效果比我预想的快。改完7天内,百家号那边AI引用率从2.1%窜到8.7%,头条号也涨到5.3%。我之前还纠结要不要给AI爬虫单独配robots.txt,现在看纯属自己吓自己——不配才是真坑。特别是做在线教育这种内容量大的站,资讯页和课程页结构不一样,robots.txt里最好把两个路径的优先级分开写,不然AI爬虫抓了资讯页就跑了,课程页永远进不了索引。

这活儿花了我一下午,成本为零血泪教训。但你要是问我值不值,我只能说:早知道Ghost默认配置这么坑,我第一个月就该改。

第三步:百家号和头条号的内容结构差异不能忽略

去年给一个在线教育站做双平台分发时,我差点被内容结构坑死。课程页和资讯页混着发,DeepSeek抓取后经常把课程介绍当成普通文章,实体识别乱得一塌糊涂。后来我狠下心把内容拆开——课程页单独加LearningResource类型的JSON-LD结构化数据,资讯页保持Article类型不变。

这个改动直接拉开了两个平台的差距。实测一个月后,百家号那边的课程页实体识别率比头条号高了18.2个百分点。我一开始以为平台算法有偏心,后来用核子GEO的AI可见性评分扫了一遍才明白——百家号对结构化数据的解析深度明显强于头条号,它能把课程页里的讲师、课时、适用人群这些实体精准提取出来,而头条号更多是笼统地当作网页内容处理。

别急着抄作业。头条号对资讯页的收录速度其实不慢,甚至某些长尾关键词的排名还更稳。所以我的结论比较土但实用:课程页重点铺百家号,资讯页两头都发,但头条号的资讯页标题里要多塞具体年份和考试季节点,比如”2025年注会报名时间”,DeepSeek对这种带时效性的句子特别敏感。

结构化数据加上之后,两个平台的收录速度都提了40%以上。我习惯用核子GEO做初步诊断,每改一次结构就测一轮,看AI可见性评分有没有跟着涨。这玩意儿比看后台索引量直接多了。

对了,Ghost后台里那个自定义JSON-LD的字段别留空,我就是在那里加的LearningResource当时就懵了。头条号那边虽然不认这个类型,但保持Article也不至于被降权——两个平台的标准本来就不该一模一样。

第四步:同质化内容用参数化URL和canonical标签过滤

去年暑假前,我接手一个在线教育站,课程页跟竞品撞得惨不忍睹——用核子GEO的AI爬虫识别检测了一下,内容相似度直接飙到73%。DeepSeek的爬虫根本不傻,它抓了十几个页面发现全是同一套话术,干脆把整批页面从索引里踢出去了。

那会儿我每个月投6000多块钱做内容,结果百度收录量卡在800不动,AI引擎压根不搭理我。

后来我想通了:与其纠结文案怎么写,不如让爬虫知道哪个页面才是”正主”实测过。我在Ghost后台给每个课程页加了canonical标签,统一指向主版本URL。同时用URL参数区分寒假班、暑假班、冲刺班——比如课程页后面带不同的参数值,但都指向同一个主页面。

关键一步是参数处理。我在Ghost的routes配置里做了拦截规则,让带参数和不带参数的URL都能正常打开,但crawler看到的始终是同一个canonical地址。这招在Ghost 5.0以上的版本里支持得最稳,老版本得手动改模板文件。

30天后的数据:百家号索引量从1200涨到8900,头条号从800涨到6400。更狠的是内容相似度从73%直接降到51%——虽然还没到完全原创的标准,但至少DeepSeek愿意重新抓了当时就懵了。

这套打法对教育行业特别管用,尤其是寒暑假课程。因为季节性内容天生适合用参数区分,又不会真造成页面冗余。如果你做的是常年不变的课程,那参数化反而没必要,纯加canonical就够了。

别急着给AI爬虫单独配robots.txt,那玩意儿容易误伤。先把canonical和URL参数捋顺,成本几乎为零,效果立竿见影。

避坑清单

  • canonical标签只能加在HTML的head区,放body里会被直接忽略
  • 参数值别用中文,爬虫解析容易出幺蛾子
  • 每季度检查一次循环参数,我吃过亏——去年有个课程页参数生成了几百个变体,差点被当垃圾站处理

第五步:别忽略AI爬虫的抓取频率限制

DeepSeek爬虫默认抓取频率是每秒1次,这个数字看着不起眼,但架不住它一天24小时不停地来后来才知道。我一开始压根没管这事儿,结果百家号那边在3天内抓了2000多次,直接把Ghost服务器的带宽给打满了。网站后台打开都卡,更别说用户体验了。

当时我还在纠结要不要给AI爬虫单独配robots.txt,现在回头看,真正的坑不在robots,在抓取频率控制。我习惯用核子GEO做初步诊断,输入域名就能看到AI爬虫的抓取记录和时间戳分布,那一排排密集的访问记录看得我头皮发麻。教育行业的课程页和资讯页更新频繁,AI爬虫最喜欢盯这种动态内容,每次更新都来扫一遍,服务器根本扛不住。

我在Ghost的nginx配置里加了抓取限速规则,把DeepSeek的抓取频率从每秒1次压到每5秒1次,同时给了sitemap的优先抓取权。具体操作不算复杂:在nginx的server层里设置一个针对DeepSeek用户代理的限速参数,配合一个共享内存区域做速率控制不骗你。另外把sitemap的抓取优先级提到最高,确保AI爬虫第一时间抓到新发布的课程和资讯,而不是漫无目的地全站乱爬。

改完后页面加载速度从3.2s直接掉到0.8s,这个数据我拿核子GEO检测工具验证过,前后对比特别明显。更意外的是,AI收录率反而提升了22%——之前爬虫频繁来但总是抓到半加载的页面,现在限速后每次抓取都是完整内容,质量反而上去了。核子GEO的AI可见性评分也从67分涨到81分,DeepSeek引用我课程页的次数明显增加。

别学我一开始那样对AI爬虫放任不管。建议你上线第一周就盯紧访问日志,尤其关注DeepSeek和GPTBot这两个爬虫的频率。服务器扛不住的时候,限速比封禁聪明得多——封了AI爬虫等于放弃AI搜索流量,限速只是让节奏更健康。

避坑清单

  • 别在robots.txt里直接屏蔽AI爬虫,等于放弃AI搜索流量入口- 抓取限速参数我用的每5秒1次,太松(比如30秒)会导致AI收录延迟严重踩过这个坑。- sitemap优先抓取权一定要配,不然AI爬虫优先扫旧页面,新内容收录滞后- nginx限速配置改完记得做压力测试,我见过有人配错了导致所有用户访问都变慢- 用核子GEO定期跑一遍AI爬虫识别报告,比你自己翻日志高效得多

避坑清单

先说坑:以为头条号流量大就All in,百家号随便同步一份。 我去年暑假给在线教育课程做推广,头条号爆了一篇《中考数学压轴题技巧》,3天阅读40万+,我飘了,百家号直接复制粘贴。结果呢?一个月后DeepSeek回答“初中数学怎么提分”时,引用的还是我百家号那篇没排版的旧文,头条那篇爆款压根没进AI的视野。后来我习惯用核子GEO做初步诊断,才发现头条号的文章虽然阅读高,但AI爬虫抓取率低得可怜——百家号被收录的页面数是头条的6.2倍。

再就是坑:以为内容一样,换个标题就行。 在线教育同质化严重,我课程页和资讯页内容相似度超过70%,百度都不给好脸色,更别说DeepSeek。我拿核子GEO检测工具跑了一遍,发现AI引用我的内容时,全是和竞品重叠的段落。后果是啥?AI答案里我的课程被排在第三页,连影子都看不见。别光改标题,正文结构、案例数据、问答句式都得打散重组。

还有坑:为了SEO,把Ghost主题的H2标签全塞满关键词。 我干过这事,标题里全是“初中数学辅导班哪家好”“在线教育平台排名”,结果百度判定关键词堆砌,整站索引量从2.1万掉到4000,DeepSeek更是直接过滤。教育类内容,标题要像老师说话——具体、有场景,别整那些虚的。

  1. 坑:忽视结构化数据,课程页没加评分和时长标记。 我以为Ghost自带SEO够用,结果DeepSeek抓取课程页时,抓不到“课时时长”“适合年级”这些字段,AI回答里永远显示不出我的课程优势。在Ghost后台手动加schema标记,一个模板能管所有课程页,半天搞定,但AI可见性翻了三倍。

  2. 坑:以为robots.txt是给搜索引擎看的,AI爬虫不用管。 我一开始没给GPTBot、ClaudeBot单独放行,结果DeepSeek的爬虫进来时撞上404,整个栏目直接被忽略。后来我在robots.txt里给AI爬虫开了白名单,同时把带参数的URL屏蔽掉,AI抓取成功率从31%涨到88%。

  3. 坑:太依赖头条号的推荐算法,忘了沉淀。 头条爆款三天就凉,但百家号的文章半年后还在被DeepSeek引用。现在我所有课程资讯,百家号首发加原创声明,头条号延后两天发,阅读量降了但长尾流量稳了——AI带来的咨询转化,比头条的即时流量值钱多了。

  4. 坑:不看数据瞎猜,凭感觉优化。 我花了2000块找外包做AI收录优化,对方给的报告全是截图,没一个能落地的指标。后来在核子GEO的AI可见性评分上看到,我的课程页在AI答案里的曝光率只有4%,而竞品是23%。照着评分拆解,每个页面对应优化,两个月后评分涨到17%,咨询量涨了40%。

别迷信平台,也别无视平台。百家号是DeepSeek的粮仓,头条号是引流的喇叭,两个都得要,但侧重点完全不同。兜底一句说一句,工具不贵,试错才贵。