2026-08-26

robots.txt 别误封 AI 爬虫:GEO 放行清单与五个常见坑

做 GEO 最憋屈的一种失败,不是内容写得差,而是你根本没被发现——AI 爬虫在门口就被挡回去了。问题往往出在一份不起眼的 robots.txt,或者更隐蔽的 WAF 规则上。本文专门讲怎么把"门"给 AI 爬虫打开,并列出五个最常踩的坑。

为什么这件事能一票否决整个 GEO

前面讲的 llms.txt、Schema、内容改造,前提是爬虫能进来。如果 robots.txt 写的是 Disallow: /,或者你的安全插件把"非百度/谷歌"的 UA 全拉黑,那 Bytespider、Bingbot、GPTBot 全进不来。你后面的努力,模型一个字都看不到。它排在技术基建的第一关,却最容易被忽略。

要显式放行的几个 UA

国内做 GEO,至少把这三个放开:

  • Bytespider:字节系爬虫,豆包的答案很大程度来自它;
  • Bingbot:通用全网爬虫,DeepSeek 与腾讯元宝都依赖它取数;
  • Baiduspider:百度系,文心一言采信权重与之强相关。

面向更通用的模型,可一并放行 GPTBot、ChatGPT-User、ClaudeBot、Google-Extended、Applebot-Extended。一份示例:

User-agent: Bytespider
Allow: /

User-agent: Bingbot
Allow: /

User-agent: Baiduspider
Allow: /

User-agent: GPTBot
Allow: /

User-agent: *
Disallow: /admin/
Disallow: /tmp/

注意:放行指的是"允许抓取公开内容",后台、临时目录该拦还得拦,二者不冲突。

五个最常见、也最隐蔽的坑

  • 全站 Disallow 忘了恢复。改版、上 CDN、做压测时常有人临时封全站,事后忘了开,GEO 直接停摆。
  • WAF / 安全插件按 UA 黑名单拦截。很多防护默认把"陌生爬虫"当恶意流量。robots 写了 Allow,请求在防火墙这层就被掐了——这是最隐蔽的一种。
  • 只放百度谷歌,漏了 Bytespider / Bingbot。传统 SEO 思维的习惯,做 GEO 时得补上 AI 爬虫。
  • 误封动态参数页,连产品参数页一起拦了。规则写得太粗,把 ?id= 这类本该索引的页也 Disallow 了。
  • CDN 机器人防护把 AI 爬虫当 bot 限流。Cloudflare 等默认防护可能给 AI 爬虫极低配额,表现为"偶尔能抓、大部分超时"。

怎么自查

两步就够:用 curl -A "Bytespider" 站点/robots.txt 看返回是不是允许;再直接抓一个产品页,确认没被 403。各平台的站长工具(百度资源平台、Bing Webmaster)也都能测抓取是否正常。

企开元怎么处理

建站默认生成放行主流 AI 爬虫的 robots.txt,并且在接入 CDN / WAF 时避免与之冲突——不让"安全防护"悄悄把 GEO 的入口堵上。你改版、迁移时也不用担心把门焊死。

FAQ

放行 AI 爬虫会不会泄露后台?

不会。robots.txt 只约束公开路径的抓取意愿,后台路径本就该有独立鉴权。放行爬虫等于"欢迎参观展厅",不等于"把保险柜钥匙交出去"。

旧站 robots 已经很干净了,还要动吗?

干净就不动。重点排查的是"改版后是否误封""WAF 是否额外拦截"这两类隐性问题,而不是 robots 文件本身。

门没开,里面装修再好也没人看。企开元智能建站GEO系统在技术基线上默认放行主流 AI 爬虫,并与 CDN / WAF 规则协同,避免 GEO 入口被悄悄堵死。欢迎预约演示,顺便帮你的官网做一次抓取可达性体检。

← 返回资讯动态