
Cloudflare正式推出针对AI爬取的“负责任(Accountable)”认证体系,并同步上线“禁止AI训练(Disallow AI Training)”设置。该功能允许网站在保留搜索结果展示的同时,拒绝其内容被用于AI模型训练。此举旨在落实网站所有者对AI使用其内容的控制权,并为爬取运营商设定明确的访问标准。
精细化控制与推荐设置
Cloudflare将原有的“屏蔽AI机器人”单一开关升级为三个独立控制选项,分别对应搜索、AI训练和AI代理。针对不同业务模式的网站,平台提供了差异化推荐设置:
- 广告支持类网站:建议开启搜索爬取,禁止AI训练,并在含广告页面屏蔽AI代理,以保护广告收益。
- 其他网站:默认允许搜索、AI训练和AI代理,符合大多数非广告支持网站的现有运营模式。
此外,Cloudflare以“Bot Preference Sync(机器人偏好同步)”功能取代了旧的“Managed Robots.txt”。网站所有者可一次性设置爬取偏好,系统将自动应用于所有支持的爬虫,且支持随时更改。
责任标准与合规巨头
Cloudflare确立了透明的AI爬取责任标准,混合用途爬虫运营商需满足或承诺在指定时间内满足以下四项要求:
- 通过robots.txt等标准提供明确的退出AI训练途径;
- 允许网站所有者退出由AI生成的搜索摘要;
- 提供URL级别的可见性,披露内容在搜索和训练中的使用情况;
- 公开确认退出训练不会影响网站在传统搜索结果中的排名。
目前,苹果、谷歌和微软已被标记为“负责任”的爬取方。其中,谷歌已通过Google-Extended工具实现搜索与训练的分离控制,并推出了应对搜索中AI问题的新工具。由于其他领先AI公司运营独立的搜索和训练爬虫,Cloudflare可在不影响搜索的前提下屏蔽其训练行为,因此也将相关爬虫归类为“负责任”。完整合规名单已在Cloudflare Radar平台公布。
在行业标准方面,Cloudflare正积极参与互联网工程任务组(IETF)关于“ai-prefs”规范的制定工作,旨在推动网站以标准化、可移植的方式表达AI访问偏好。当前的控制措施设计已与这些新兴标准保持协同。