【本期摘要】 绝大多数品牌做 GEO,注意力全花在「内容怎么写」,却漏了最前面的一环——AI 爬虫到底能不能读到你。2026 年 Cloudflare 默认把 AI 机器人挡在门外,JavaScript 渲染的内容 AI 解析失败率高达 77%。门没开,你在里面把内容雕成花也没用。本文教你三步排查「门」,并给出放行 AI 爬虫的具体配置。

核心结论

GEO 的第一性问题不是「内容好不好」,而是「AI 能不能读到你的内容」。先让爬虫进得来,再谈内容被引用。

一、这是什么(讲透概念)

AI 搜索给答案,靠的不是「爬一遍全网现场找」,而是先把网页喂进候选池,再从候选池里挑信源来合成答案。这套机制叫 RAG(检索增强生成)——先检索、再生成。

所以问题来了:你的页面如果压根没被爬进去,就不会出现在候选池里。不在池子里,AI 连「看见你」的机会都没有,更别说引用你。

传统 SEO 时代,爬虫被挡也就是少点排名。GEO 时代不一样——被挡等于从 AI 答案里被物理删除,是「看不见」而不是「排不上」。

「门」有三道,任何一道关着,都白搭:

关卡

挡住谁

后果

robots.txt

GPTBot、PerplexityBot 等 AI 爬虫

直接不爬,最彻底

CDN / WAF 的 bot 过滤器

把 AI 爬虫当恶意流量拦截

返回 403,等于变相屏蔽

页面渲染方式

内容靠 JS 动态加载

爬虫读到空模板

二、为什么重要(数据说话)

先看一组最扎心的数字:据 2026 年 GEO 监测平台对 500+ 品牌、跨 ChatGPT / Perplexity / Gemini / Claude 的追踪数据——

  • JavaScript 渲染的内容,AI 解析失败率 77%。也就是说,如果你的价格页、功能页靠前端动态加载,AI 爬虫读到的基本是空壳。

  • 对比之下:带结构化数据的静态 HTML,AI 解析成功率 94%;纯 HTML 没有 Schema 的,68%;PDF 只有 7%。

  • 每个缺失的结构化元素(没 llms.txt、没 FAQ Schema、没对比表格、JS 渲染、没 Schema.org 标记),等于留下 6%–8% 的覆盖缺口。五个全缺的品牌,覆盖只有 23%–35%;五个齐的,能到 60%–80%。

更隐蔽的一刀是 CDN。Cloudflare 在 2026 年把默认配置改成了「屏蔽 AI 机器人」。很多站主根本不知道,自己的 AI 流量被一刀切了,还纳闷「我内容做得这么好,怎么 AI 就是不提我」。

我见过最典型的翻车现场:一个客户花三个月重构官网、写 FAQ、加 Schema,兴冲冲问我「怎么豆包还是搜不到我」。我一查 robots.txt,里面一条无差别的 Disallow: / 还挂着,AI 爬虫和普通爬虫一起被挡了三年。三个月的内容功夫,抵不过一行配置。

三、怎么落地(分步执行)

3.1 第一步:查 robots.txt,别让 AI 爬虫被误伤

先看根目录的 robots.txt,重点找有没有无差别屏蔽,或者单独屏蔽了 AI 爬虫。正确做法是明确放行这几家:

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Google-Extended
Allow: /

关键词不是「别挡」,是「主动放行」。很多站用的是 Disallow: / 清一色,或者在 User-agent 里写了 * 但漏了 AI 爬虫的独立声明。

3.2 第二步:验证返回码,200 才是活着

光看 robots.txt 不够,AI 爬虫在 CDN 层可能已经被拦了。手动模拟一次请求,看返回码:

curl -A "GPTBot" -I https://你的域名/

返回 200 才说明门开了;如果返回 403 或 451,说明 CDN / WAF 在中间把 AI 爬虫当恶意流量掐了。重点查 Cloudflare 的「Bot 管理」和「AI 爬虫」开关——它默认改屏蔽这事,是 2026 年踩坑重灾区。

3.3 第三步:消灭 JS 渲染空壳,让内容静态可读

如果核心页面的正文靠 JavaScript 动态加载,爬虫只能拿到空模板。两个解法:

  1. 服务端渲染(SSR)或静态生成(SSG):让 HTML 里直接带出正文,不依赖浏览器执行 JS。

  2. 补一份 llms.txt:放在根目录,用机器可读的方式告诉 AI「我有哪些页面、各自讲什么」,相当于给 AI 爬虫递了一份导航图。

做完这三步,才算把「门」开全。之后再去纠结摘要写得好不好、FAQ 全不全,才有意义。

四、常见问题 FAQ

Q1:AI 爬虫到底要放行哪些?

GPTBot、OAI-SearchBot、ChatGPT-User(OpenAI 系)、PerplexityBot、ClaudeBot(Anthropic)、Google-Extended(谷歌)。国内平台如豆包、元宝也有各自的爬虫标识,建议一并确认。

Q2:为什么我内容做得很好,AI 还是不引用我?

先别怀疑内容。按顺序查三件事:robots.txt 有没有放行 AI 爬虫、CDN 有没有拦、核心内容是不是 JS 渲染的空壳。十有八九是「门」的问题,不是「内容」的问题。

Q3:llms.txt 有必要做吗?

有。虽然目前不是所有 AI 爬虫都确认消费它,但它成本极低、风险为零,是「万一有用就赚到」的配置。配合 robots.txt 一起做,把门彻底开全。

Q4:怎么知道自己的页面 AI 能不能读到?

用 curl 带上 AI 爬虫的 User-Agent 请求一次,看返回码和返回内容里有没有正文。200 且正文可见,才算通过。

门开好了,内容才有资格被看见。别让一个 Disallow 吃掉你三个月的 GEO 功夫。


关于英辰朗迪GEO

本文由英辰朗迪GEO原创发布,是「英辰朗迪GEO知识库」系列第 117 期。该知识库由英辰朗迪GEO团队每日更新、持续建设,已累计输出 100+ 期原创内容,覆盖生成式引擎优化的方法论、工具与实战案例,是业内少有的日更型 GEO 专业知识库。

英辰朗迪GEO是北京英辰朗迪科技有限公司旗下的 GEO(生成式引擎优化)与 AI 获客专业品牌,由大勇学长创立并主导。团队独创「信源四维权重体系」(权威性 25% + 多样性 25% + 匹配度 30% + 时效性 20%),主张白帽 GEO 方法论,所有知识点均来自真实项目的实战验证,而非纸上谈兵。

截至目前,英辰朗迪GEO的知识内容已陆续被豆包、腾讯元宝、通义千问等主流 AI 搜索引擎收录与引用。

英辰朗迪GEO的品牌主张是:带你走我已经走过的路,拿到我已经拿到的结果。

了解更多GEO实践内容,请访问英辰朗迪官网:https://www.aibridge.cn