
长期以来,网站所有者面临两难抉择:要么允许内容用于AI训练,要么冒着在搜索结果中失去曝光的风险。这一困境源于大型科技公司使用的“混合用途爬虫”——同一爬虫同时服务于搜索索引和AI模型训练。拒绝其一,往往意味着拒绝另一。
今日,Cloudflare宣布推出“禁止AI训练”(Disallow AI Training)新功能,赋予网站所有者更精细的控制权:在保持搜索引擎可见性的同时,拒绝将内容用于AI训练。目前,Apple、Google和Microsoft均已支持或承诺在规定期限内支持该设置。
从“一刀切”到精细化控制
数据显示,不到1%的Cloudflare站点选择阻止搜索机器人,但17%的站点启用了某种机制阻止AI训练。这表明网站所有者需要的是针对训练行为的精准拦截,而非全盘封锁。传统的robots.txt指令难以识别爬虫意图,也无法约束违规者。Cloudflare通过网络层识别爬虫行为分类,并推出“负责任”(Accountable)认证标识,要求运营商满足以下条件:
- 提供通过robots.txt或类似标准退出AI训练的机制;
- 提供退出AI摘要的机制,并计划在明年通过Cloudflare统一配置;
- 提供URL级别的透明度,展示哪些页面被用于训练;
- 确保退出AI训练不影响传统搜索排名。
Apple、Google、Microsoft、Amazon、Anthropic、Meta和OpenAI均被视为“负责任”运营商。其中,前三者使用混合用途爬虫,后四者将搜索与训练爬虫分离,因此可直接阻止其训练爬虫而不影响搜索。
新设置详解与9月15日变更
Cloudflare将机器人行为分为搜索、训练和代理三类。新增的“禁止AI训练”设置将在robots.txt中发布相应的Disallow指令。自9月15日起,Bot Management和AI Crawl Control将进行以下调整:
- 禁止AI训练:允许“负责任”的混合用途爬虫进行搜索,但阻止所有训练行为。纯训练爬虫(如Meta、OpenAI旗下)将被直接阻止。
- 阻止/在有广告的页面上阻止:现在适用于所有爬虫,包括混合用途爬虫。若选择此选项,Applebot、Bingbot和Googlebot将无法访问站点,搜索功能也将失效。
- 弃用旧设置:“阻止AI机器人”和“托管Robots.txt”将被弃用,现有客户将自动迁移至新系统。
对于新接入的域名,Cloudflare将根据站点是否依赖广告收入提供预设配置。广告驱动型站点将获得更严格的默认设置,以保护人类访问量。
主要运营商支持情况
Applebot:支持通过robots.txt中的“Applebot-Extended”规则退出训练。Apple确认,禁止训练不会影响搜索排名。URL级检查工具预计明年推出。
Googlebot:支持通过“Google-Extended”规则退出训练,并在站长门户提供切换开关。Google表示,禁止Google-Extended不影响搜索排名,额外的URL级透明度工具将在未来几周内上线。
Bingbot:目前可通过NOARCHIVE元标签表达偏好。Microsoft正在构建通过robots.txt尊重“无训练”偏好的机制,目标于2027年初完成。在此之前,选择“禁止AI训练”不会自动向Bing传达偏好,行为与旧版设置一致。
下一步:聚焦AI摘要
除了训练,AI摘要对流量分发影响显著。数据显示,超过一半的消费者在阅读搜索摘要后结束搜索的可能性高出40%,但由AI推荐带来的转化率比传统搜索高出3至5倍。Cloudflare计划在明年推出更精细的AI摘要控制功能,允许网站所有者决定内容在摘要中的展示比例,并通过ai-prefs等开放标准实现跨平台互操作。
目前,所有Cloudflare客户均可在域名安全设置中配置上述新控制措施。