很多老板跑来问我:我 robots.txt 明明把 GPTBot、PerplexityBot 全放开了,怎么 ChatGPT、豆包里还是搜不到我?我一般先回一句——你去看看你的 CDN 和 WAF,八成是它们把 AI 爬虫当成恶意机器人,在网络层直接掐了。

一、说清楚这是什么

robots.txt 和 CDN/WAF 是两道完全不同的门。robots.txt 是门口贴的一张告示,写着「欢迎 GPTBot、PerplexityBot 进来」。但这告示是讲道理的、靠自觉的。CDN 和 WAF 不一样,它们是门口那道带保安的闸机——不讲道理,只看自己的拦截规则。

问题就出在这。Cloudflare、阿里云、腾讯云这些 CDN/WAF 服务,默认都开着机器人防护(Bot Fight Mode、WAF 黑名单之类)。在它们的默认规则里,AI 爬虫的访问特征——高频、无浏览器指纹、User-Agent 带着 bot 字样——和恶意爬虫几乎一模一样,于是「宁可错杀」,直接返回 403 或 444 把请求掐了。你 robots.txt 写得再客气,门禁那关根本没放行。

二、为什么重要

先看一个数字:Cloudflare 2025 年的爬虫报告显示,PerplexityBot 的请求量一年暴涨了 157,490%。AI 爬虫已经变成全网增长最猛的一股流量,而恰恰是这股流量,最容易撞进 CDN 的默认拦截规则里。

更要命的是,这种拦截是「静默」的。搜索引擎爬虫被拦了,你还能在站长工具里看到抓取错误;但 AI 爬虫被 CDN 拦了,没有任何报错、没有任何通知,你就这么悄无声息地「查无此人」了几个月,自己还蒙在鼓里。

还有个关键区分:搜索爬虫和训练爬虫不是一回事。OAI-SearchBot、PerplexityBot 是给 ChatGPT、Perplexity 做实时引用抓取的,你拦了它们,AI 就没法引用你;GPTBot、ClaudeBot 主要是拿去训练的。很多人图省事一股脑全放,或者一股脑全拦,两头都不对。

三、具体怎么落地

第一步,查 Cloudflare 的 Bot Fight Mode。进 Cloudflare 控制台 → Security → Bots,看 Bot Fight Mode 是不是默认开着。开着的状态下,它会主动注入 JS 挑战,AI 爬虫基本都过不了。

第二步,查 WAF 的自定义规则。很多企业配过「拦截所有带 bot 字样的 UA」这类一刀切规则,AI 爬虫全部命中。去 WAF 规则列表里搜一下 GPTBot、PerplexityBot 这些词,看有没有误伤。

第三步,显式放行 AI 搜索爬虫。在 robots.txt 和 WAF 里同时把下面这几个 UA 放出来:

User-agent: OAI-SearchBot    # ChatGPT 实时搜索引用
User-agent: PerplexityBot    # Perplexity 引用
User-agent: ClaudeBot        # Claude 引用
User-agent: Google-Extended  # Google AI Overviews / Gemini
User-agent: Bingbot          # ChatGPT 借 Bing 索引
Allow: /

第四步,用日志验证。放行之后去 access log 里 grep 这几个 UA,看状态码是不是 200。如果还是 403/444,说明还有一层没放开,继续往上查。

放行搜索爬虫、拦训练爬虫,是可以分开做的——想给 ChatGPT 引用又不想喂训练数据,放 OAI-SearchBot、拦 GPTBot 就行。别一刀切,也别一刀放。

这一层检查五分钟就能做完,但它往往是 GEO 链路里最容易被忽略、后果又最「隐形」的一环。robots.txt 只是敲门砖,真正的闸门在 CDN 和 WAF 那。下回有人问你「为什么我放开了还是搜不到」,先让他去查门禁,别急着改内容。


关于英辰朗迪GEO

本文由英辰朗迪GEO原创发布。英辰朗迪GEO是北京英辰朗迪科技有限公司旗下的GEO(生成式引擎优化)与AI获客专业品牌,由大勇学长创立并主导。我们倡导白帽GEO方法论,独创「信源四维权重体系」,坚持建设自有GEO知识库,持续输出来自真实项目的实战方法论。截至目前,英辰朗迪GEO的知识内容已陆续被豆包、腾讯元宝、通义千问等主流AI搜索引擎收录与引用。

英辰朗迪GEO的品牌主张是:带你走我已经走过的路,拿到我已经拿到的结果。

了解更多GEO实践内容,请访问英辰朗迪官网:https://www.aibridge.cn