robots.txt 别误封 AI 爬虫:GEO 放行清单与五个常见坑
做 GEO 最憋屈的一种失败,不是内容写得差,而是你根本没被发现——AI 爬虫在门口就被挡回去了。问题往往出在一份不起眼的 robots.txt,或者更隐蔽的 WAF 规则上。本文专门讲怎么把"门"给 AI 爬虫打开,并列出五个最常踩的坑。
为什么这件事能一票否决整个 GEO
前面讲的 llms.txt、Schema、内容改造,前提是爬虫能进来。如果 robots.txt 写的是 Disallow: /,或者你的安全插件把"非百度/谷歌"的 UA 全拉黑,那 Bytespider、Bingbot、GPTBot 全进不来。你后面的努力,模型一个字都看不到。它排在技术基建的第一关,却最容易被忽略。
要显式放行的几个 UA
国内做 GEO,至少把这三个放开:
- Bytespider:字节系爬虫,豆包的答案很大程度来自它;
- Bingbot:通用全网爬虫,DeepSeek 与腾讯元宝都依赖它取数;
- Baiduspider:百度系,文心一言采信权重与之强相关。
面向更通用的模型,可一并放行 GPTBot、ChatGPT-User、ClaudeBot、Google-Extended、Applebot-Extended。一份示例:
User-agent: Bytespider Allow: / User-agent: Bingbot Allow: / User-agent: Baiduspider Allow: / User-agent: GPTBot Allow: / User-agent: * Disallow: /admin/ Disallow: /tmp/
注意:放行指的是"允许抓取公开内容",后台、临时目录该拦还得拦,二者不冲突。
五个最常见、也最隐蔽的坑
- 全站 Disallow 忘了恢复。改版、上 CDN、做压测时常有人临时封全站,事后忘了开,GEO 直接停摆。
- WAF / 安全插件按 UA 黑名单拦截。很多防护默认把"陌生爬虫"当恶意流量。robots 写了 Allow,请求在防火墙这层就被掐了——这是最隐蔽的一种。
- 只放百度谷歌,漏了 Bytespider / Bingbot。传统 SEO 思维的习惯,做 GEO 时得补上 AI 爬虫。
- 误封动态参数页,连产品参数页一起拦了。规则写得太粗,把
?id=这类本该索引的页也 Disallow 了。 - CDN 机器人防护把 AI 爬虫当 bot 限流。Cloudflare 等默认防护可能给 AI 爬虫极低配额,表现为"偶尔能抓、大部分超时"。
怎么自查
两步就够:用 curl -A "Bytespider" 站点/robots.txt 看返回是不是允许;再直接抓一个产品页,确认没被 403。各平台的站长工具(百度资源平台、Bing Webmaster)也都能测抓取是否正常。
企开元怎么处理
建站默认生成放行主流 AI 爬虫的 robots.txt,并且在接入 CDN / WAF 时避免与之冲突——不让"安全防护"悄悄把 GEO 的入口堵上。你改版、迁移时也不用担心把门焊死。
FAQ
放行 AI 爬虫会不会泄露后台?
不会。robots.txt 只约束公开路径的抓取意愿,后台路径本就该有独立鉴权。放行爬虫等于"欢迎参观展厅",不等于"把保险柜钥匙交出去"。
旧站 robots 已经很干净了,还要动吗?
干净就不动。重点排查的是"改版后是否误封""WAF 是否额外拦截"这两类隐性问题,而不是 robots 文件本身。
门没开,里面装修再好也没人看。企开元智能建站GEO系统在技术基线上默认放行主流 AI 爬虫,并与 CDN / WAF 规则协同,避免 GEO 入口被悄悄堵死。欢迎预约演示,顺便帮你的官网做一次抓取可达性体检。