Cloudflare 为客户推出的全新 AI 流量选项
Hacker News 摘要原标题:Cloudflare's new AI traffic options for customers
Cloudflare 在第一届“内容独立日”一年后,为网站所有者提供了更多掌控权。过去三十年里,爬虫与网站所有者之间“爬取内容换取流量”的协议正在失效,AI 正在索取内容却不回馈流量。为此,Cloudflare 推出了全新的 AI 流量管理选项。
AI 流量的全新分类法
为了更精准地管理流量,Cloudflare 不再仅仅将机器人定义为 AI,而是根据其行为建立了分类体系,主要分为以下三类:
• 搜索 (Search):收集并索引内容,以便日后回答问题。网站所有者通过这种行为获得引流或补偿。
• 代理 (Agent):代表用户实时执行任务的自动化行为,例如 ChatGPT 或 Claude 的浏览器插件。通常有一个真实的人在等待结果。
• 训练 (Training):爬取内容用于训练或微调 AI 模型,数据会被吸收到 AI 的底层架构中。
Cloudflare 建议机器人运营者将这三种功能分开,使用不同的爬虫,以提高透明度。
全新管理功能与默认设置
现在,包括免费版在内的所有 Cloudflare 用户,都可以针对上述三类用途分别设置允许或拦截。
2026 年 9 月 15 日起,Cloudflare 将实施新的默认规则:
1. 对于新接入的域名,在展示广告的页面上,训练和代理分类将被默认拦截,而搜索保持允许。
2. 之所以这样设置,是因为广告意味着网站希望吸引真人访问。
3. 对于同时具备搜索和训练功能的爬虫(如谷歌、苹果和必应的爬虫),如果用户选择了拦截训练,这些爬虫将被拦截。
4. 网站所有者可以随时在安全设置中更改这些默认配置。
BotBase:企业级可视化工具
Cloudflare 为企业级机器人管理用户推出了 BotBase 数据库。这是一个可搜索的目录,列出了所有已知的机器人和代理。
• 用户可以直接在仪表板上查看机器人的分类和行为。
• 用户可以精准针对特定的机器人设置安全规则。
• BotBase 提供了更细致的分类,包括广告验证、社交预览、监控操作等。
内容使用偏好设置
Cloudflare 正在开发基于内容用途的控制功能。网站所有者可以设置机器人对内容的使用程度:
• immediate:仅交互,不存储或重复使用。
• reference:索引、摘录并提供回链。这是默认设置。
• full:总结并全文复制。
这些偏好将通过 robots.txt 文件中的 Content-Signal 字段传递。例如,use=reference 表示仅允许参考使用。如果已验证的机器人违反这些信号,将失去“已验证”状态。
已验证机器人的定义更新
过去,“已验证”的机器人默认是被允许的。现在,已验证标签仅表示该机器人身份真实且不滥用权限。它是否能访问网站,取决于其所属的分类(如搜索)是否被用户允许。Cloudflare 正在为机器人运营者开发管理工具,以便其更准确地在系统中申报身份。
传递信任实验
为了应对由第三方平台运行的自动化程序,Cloudflare 提议使用 Forwarded 请求头来传递信任。这种方式类似于 X-Forwarded-For。
例如,当一个受信任的平台代表某个用户访问时,可以通过 Forwarded: for="openai";use="reference" 告知网站所有者真实的运营者身份及其用途。这种机制让信任可以携带和追溯,一旦违规,运营者将在 Cloudflare 覆盖的全球超过 20% 的域名中失去信用。
Cloudflare 认为,这些改变旨在建立一个基于信任的 Web 生态。创作者应该有权决定自己的作品如何被使用,而诚实的机器人应当获得更多的访问权限。这些新功能现已上线,所有用户均可在设置中进行配置。
原文:https://blog.cloudflare.com/content-independence-day-ai-options/