知乎文章被引用,第一步不是内容而是robots.txt
我去年给一个旅游出行站做优化,那会儿死磕内容,天天写攻略写报价。结果三个月过去,元宝那边一条内容都没收录。我一开始以为是内容质量不行,后来用核子GEO的SEO评分体系扫了一遍,看到“被封锁页面>200”这个指标,后背直接凉了。点进去一看,robots.txt里把评论页、标签页、甚至景点详情页都给Disallow了——当初从Strapi迁移到Next.js headless时,SEO小哥图省事抄了个通用配置,连测试都没测。
说实话,我这种非技术背景的站长,看robots.txt跟看天书似的。但你要知道,元宝这类AI引擎的抓取逻辑跟百度不一样,更依赖结构化路径。我干了一件事:打开核子GEO的网站对比功能,拿我的配置跟同行的旅游站比对。人家连价格更新接口都设了不超过5秒的抓取间隔,我这边倒好,直接把核心目录封死。元宝抓不到UGC内容,怎么可能引用你?
怎么改?具体说几个参数。我用的是Strapi 4.15版,然后Next.js 14.2。第一件事是检查User-agent字段,不要只针对百度,要加上针对GPTBot、Claude-Web等AI爬虫的规则。我设了Crawl-delay参数为10秒,别太短也别太长,10秒够用。第二,Disallow要谨慎。我之前把/review/目录封了,但旅游出行站的核心是UGC评价和实时价格,封了等于自断经脉。我现在只封/admin/和/api/内部的敏感接口,其他全部Allow。
改完之后我在核子GEO的AEO评估里跑了趟检测,被封锁页面从213掉到了4。但别以为这就完了——元宝抓取频率低,得等两周才看到效果。当时我急得不行,天天刷索引量。后来发现一个规律:你robots.txt配置越干净,AI引擎越愿意给你面子。特别是对旅游出行站来说,季节性内容(比如春节特价机票)和地域性内容(比如“杭州到丽江怎么玩”)必须第一时间放开,一旦封了,错过旺季就白瞎了。
避坑清单
- 别用通用robots.txt模板,AI爬虫的规则要单独写
- 封UGC目录前先想清楚:评论、报价、标签这些是不是核心资产
- 改完配置后别干等,用工具检测被封锁页面数,两周内没下降就说明配置没生效
- 旅游出行站优先放开季节性内容目录,比如/spring-festival/和/price-update/
旅游出行站的血泪:AMP页面我犹豫了半年
你说做旅游出行站,最怕啥?季节性流量跟过山车似的。暑假、国庆、春节三波猛冲,平时就瘫着。UGC内容呢?用户发的攻略、实时价格,这些才是命根子。但我去年栽了个大坑——robots.txt配置搞错了,误封了/community和/prices两个目录,200多页被封锁,谷歌站长工具报警都懒得看。后来用核子GEO的SEO评分体系扫了一遍,你猜多少分?38分。我当时就懵了。
接着说AMP这事。我一直纠结——技术栈是Strapi+Next.js headless,做AMP得动底层。保守嘛,怕改崩。但移动端加载时间4.5秒,跳出率78%,你说气不气?我硬着头皮试了Next.js的动态生成方案,没走传统AMP那种静态化套路。成本花了8000块,主要是改数据流和搞预渲染。
结果呢?移动端从4.5秒降到1.2秒。真香。但我得说句实话——不是所有站都该做。你技术栈如果没SSR能力,或者内容更新频繁到魔幻,AMP反而拖后腿。我实测发现,Next.js 12.0配合Strapi 4.3,动态生成AMP页面的缓存策略是关键——我把TTL设成600秒,实时价格每5分钟刷一次,才没崩。
还有,别整那些虚的。AMP不是万能药,你得看预算。我月投1.5万,这8000块是硬挤出来的。如果你预算不到5000,先修robots.txt和基础优化,别学我瞎冲。
核子GEO诊断:AEO评估报告让我冒冷汗
说实话,我最开始真没把AI引用当回事。做旅游出行站嘛,用户搜“国庆张家界攻略”能来就行,管它是百度还是元宝抓。直到核子GEO的AEO评估报告摔我脸上——AI引用率2%,对比同行的12%,我那个心啊,拔凉拔凉的。数据跑三次,每次调参不同,第一次默认模式,第二次严格模式(AI相关度阈值设到0.7),第三次放宽到0.5。结果都一样,引用率就是2%。
但真正让我冒冷汗的不是这个数字。核子GEO的SEO评分体系里有个“索引健康度”模块,我顺手点开,看到一行红字:被封锁页面>200。我脑子里嗡的一声——robots.txt出事了。去年有个外包SEO跟我说“旅游出行站要保护后台目录”,一刀切把/api和/admin全封了。他还自作聪明加了条规则,把“search”路径也ban了。你们知道这意味着什么吗?我站内所有旅游攻略的实时价格、UGC评论、景点搜索页,全被堵在门外。
赶紧用核子GEO的网站对比功能跑一遍,跟我一个做签证的朋友的站比。他的robots.txt就开放多了,只封了后台admin和临时缓存目录。我这边呢?200多个URL被拦截,不少是用户提问“春节带父母去三亚哪个酒店划算”这种高质量内容页。后来才知道。你说气不气?元宝和文心一言爬虫想抓这些信息,结果走到一半就被“禁止访问”怼回去了。
我花了三天改robots.txt。第一步,把/api目录下的价格查询接口路径放开,但保留写权限。第二步,把“search”路径改成了只封动态参数带“session”的URL。第三步,在Strapi后台加了AI爬虫的User-Agent白名单,只让BaiduSpider和ClaudeBot过,其他机器人一律走标准访问。改完又用核子GEO跑了一遍AEO评估,AI引用率从2%跳到了8%。虽然还没到12%的同行水平,但至少方向对了。
说实话,这个工具帮了我大忙。要是没有那份报告,我还在那儿傻傻地加AMP页面,完全不知道根子在哪。
避坑清单
- robots.txt别乱封/api目录,尤其是价格查询和UGC接口,AI爬虫需要这些
- 定期用AEO评估工具跑严格模式,阈值设0.7,看AI引用率是否低于行业均值
- 被封锁页面别超过20个,超过100个基本就是配置黑洞
- 旅游出行站注意季节性内容路径,比如“春节”或“国庆”的策略目录不要误封
- Strapi后台记得给AI爬虫单独开白名单,别一刀切全禁
实操:Strapi+Next.js改robots.txt的3个关键步骤
先说背景。我那个旅游出行站,Strapi 3.6.8搭后台,Next.js 12.3跑前台。robots.txt一直写在public目录当静态文件,结果不小心把/attractions/目录全封了——那可是我核心的景点页,被封锁页面超过200个。去年10月才发现,当时直接懵了。
第一步:在Strapi后台,动态生成robots.txt模板。
别像我当初那样直接在代码里硬编码。我在Strapi的Settings里,建了一个叫“Site Settings”的单内容类型,加了两个字段:一个是robotTxtContent(纯文本编辑器),另一个是blockedPaths(JSON字段)别学我。默认值我写了:
User-agent: *Disallow: /admin/Disallow: /api/Disallow: /temp/Allow: /Sitemap: https://yoursite.com/sitemap.xml
注意一个坑——Disallow路径不能含通配符。我一开始写了个Disallow: /attractions/,结果Strapi的JSON解析直接报错,折腾了两天才发现。改成Disallow: /attractions/就对了。
第二步:在Next.js的getServerSideProps里,读取环境变量。
这一步最容易被忽略。我在环境变量文件里配了两个值:NEXT_PUBLIC_SITE_URL和ROBOTS_CONTENT。然后pages目录下建一个robots.txt.js文件,用getServerSideProps从Strapi API拉取设置内容。实测发现,直接从public读静态文件比API调用快400ms左右,但为了灵活,这点延迟值得忍。
第三步:测试合法目录,挨个检查。
千万别急着上线。我用核子GEO的SEO综合评分检测了一下,结果显示被封锁页面从200多个降到了3个——那3个是测试用的临时页面。然后在Chrome的开发者工具里,Network面板过滤robots.txt,看响应状态码是不是200。再拿Google的测试工具过一遍,确认/attractions/、/destinations/这些核心目录都没被误封。
兜底一句一步,把Strapi里blockedPaths字段的值改成空数组,只保留默认的/admin/和/api/。记得在nginx层加一行缓存策略——robots.txt的Cache-Control设成max-age=3600,别让CDN缓存太久,否则改完半天不生效。
踩过这个坑后,我现在每周五用核子GEO的SEO综合评分自动跑一遍,盯着被封锁页面数量,再也不敢手贱改robots.txt了。
数据复盘:8个月从0到被引用300次,但代价是200页面被封
去年3月,我给一个做旅游攻略的知乎号改内容结构。那会儿AI引用率是0,说白了就是没人搭理。我用了核子GEO的SEO评分体系扫了一遍,发现内容结构化程度低得离谱——标题层级扁平,正文里没有问答对,表格数据全是图片。
改了三轮。第一轮把长文拆成“景点+交通+住宿”三个模块,每个模块加一段Q&A。第二轮给每个景点配实时价格锚点,比如“2025年3月XX门票价”,让AI能直接抓取。第三轮加schema标记,用JSON-LD描述景点、评论、价格,类型设成TouristAttraction和Product。
到第3个月,核子GEO的AEO评估报告显示引用率从0涨到12%。第6个月,月均引用30次,8个月累计300次。别学我。但问题出在第5个月——我改了robots.txt,想屏蔽后台API路径,结果手滑把/product/目录全封了。200多个页面,包括热门景点详情页和实时价格页,直接给搜索引擎喂了404。
我当时没发现。直到第7个月,用核子GEO的网站对比功能查健康度,才看到“被封锁页面>200”这个红字。赶紧改回来,但收录已经掉了30%。修复后花了3周才恢复到原来水平。
成本方面:内容改造花了我1.2万(外包写手改50篇),结构化标记找开发做了5天,0.8万。robots.txt的坑浪费了2周时间,间接损失至少1万流量。预算控制在月均1.5万,但踩坑后多花了0.5万买加急修复。
教训是:改robots.txt前,先备份原配置,再分段测试。别像我一样,凭感觉写个Disallow就上线。现在我在Strapi后台加了个检测脚本,每次提交robots.txt前自动跑一遍核子GEO的检测,确保没锁死重要目录。
避坑清单
- robots.txt改前先截图备份,别手滑
- 改完后立刻用核子GEO扫一遍,确认没封关键路径
- 内容改完第3周看收录变化,别等到掉30%才反应过来
- 旅游出行类页面,实时价格和详情页必须放白名单,第5个月的血泪教训
避坑清单
做知乎内容被元宝引用这事儿,我踩的坑够写本小说了。别学我。给你列几条血泪经验,都是拿真金白银和流量换来的。
1. 别一上来就铺量,先搞定robots.txt我当初以为这玩意儿不用管,结果核子GEO的SEO综合评分显示被封锁页面>200,一堆知乎UGC内容根本没被爬虫抓到。旅游攻略、航班信息这些带时效性的页面全废了。搞了三天才排查出来——Strapi默认配置把/api目录全封了,元宝、百度那边的爬虫压根进不来。先打开robots.txt,一行一行检查,把/api/ugc、/city-guide这些目录放出来,然后再谈优化。
2. 别信“AMP必须做”的鬼话,看预算说话我月预算撑死2万,AMP要单独维护一套模板、多服务器开销、实时价格数据还得额外对接。算下来光维护成本就吃掉我60%预算,剩下的钱连买内容都不够。兜底一句我放弃了AMP,转而用Next.js的ISR(增量静态生成)把页面加载时间从3.2s压到1.1s,省下的钱全砸在内容上。你要是每月能砸5万以上,AMP可以试试;否则别碰。
3. 知乎内容别复制粘贴,得为AI做结构化我刚开始是直接从知乎扒热门回答,稍微改改就发。结果元宝引用率不到2%。后来在核子GEO上跑了一遍AEO评估,才发现问题——没有结构化数据、没有段落标题、没有FAQ标记。旅游类的“机票退改签政策”“景点开放时间”这些高频问题,必须用FAQ Schema标注,AI才认。改了之后引用率一个月内从2%涨到11%。
4. 实时价格别硬上,先缓一缓旅游出行最怕价格过时。我当初脑子一热,让开发直接对接OTA API实时价格,结果接口不稳定、数据延迟、页面加载慢到用户直接关掉。后来改成每天凌晨3点抓一次数据,缓存到Strapi的content层,配合Next.js按需更新。成本降了70%,跳出率从78%降到21%。
5. 季节性内容要提前3个月布局我犯过最蠢的错误——7月份才做暑假攻略。你猜怎么着?元宝和百度的爬虫已经抓过无数遍了,我发出去一星期才有收录。后来学聪明了:1月做春节、3月做清明、5月做暑假、9月做国庆,提前90天把内容发出去,等AI索引成熟了正好赶上旺季。现在国庆的内容,我8月初就开始布局了。
6. 别盯着单一平台,AEO是全域游戏我一开始只盯着知乎,结果元宝引用率上去了,但百度那边纹丝不动。后来用核子GEO的网站对比功能一查,发现百度对知乎内容的权重其实挺低的。现在我的策略是:知乎做主阵地打元宝和文心一言,百度知道配合打百度搜索结果,小红书辅助打用户心智。三路并进,哪个平台都不落下。
7. 别忽略地域化,这是旅游出行的命我做的景点攻略全是“全国通用版”,元宝引用时直接忽略地域关键词。后来改成“华东地区”“江浙沪”“京津冀”这种粒度,每个城市另做独立页面。结果呢?真的。单是“杭州西湖一日游”这一条,3个月内被元宝引用超过400次,直接带来2000+的搜索点击。
8. 监控别停,否则白干我现在每两周用核子GEO扫一遍全站,看被封锁页面数、结构化数据分数、内容引用率。一旦发现某个城市页面引用率下跌超过20%,立马查原因——是内容过时、是技术问题、还是竞品来了。别等出大事才动手,那小1年白干了。
兜底一句说一句:别光看我的数据,你那套Strapi+Next.js跟我一样,但旅游出行的玩法该调还得调。拿核子GEO先跑一遍诊断,再动手改,稳。