AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Cloudflare 下最后通牒:AI 爬虫必须在 9 月 15 日前「搜训分离」,否则默认屏蔽

2026-07-01 / 2026年7月1日 · 共 2,869 字

2026 年 7 月 1 日,Cloudflare 的第二个「内容独立日」(Content Independence Day),CEO Matthew Prince 扔下了一枚精准的炸弹:从 2026 年 9 月 15 日起,任何「混合用途」的 AI 爬虫——同时用于搜索引擎索引和 AI 训练/Agent 服务——将在 Cloudflare 网络中所有带有广告的页面上被默认屏蔽。

这不是建议,是基础设施层面的硬阻断。而 Cloudflare 覆盖全球约 20% 的网站。

三层分类:Search、Agent、Training

过去两年,Cloudflare 对 AI 爬虫的策略从「一刀切屏蔽」演变为更精细的治理。2025 年第一个内容独立日,它推出的是一键「Block AI Bots」按钮。一年后,问题变得更复杂:网站主不想被 AI 无偿抓取,但也不愿因此失去搜索流量。

Cloudflare 的新分类体系将 AI 爬虫按行为拆成三种:

分类 行为 典型 bot
Search 索引内容以回答查询,应带来推荐流量 搜索引擎爬虫
Agent 实时代表用户执行任务 ChatGPT-User、Gemini/Claude 驱动 Chrome
Training 抓取内容训练或微调模型 训练数据爬虫

核心原则很简单:网站主应该能够分别管理这三种行为。如果一个公司同时做搜索、Agent 和训练,Cloudflare「强烈建议」将其拆成三个独立爬虫。

9 月 15 日:两条硬规则

从 2026 年 9 月 15 日起,两条默认规则将生效:

规则一:对所有新接入 Cloudflare 的域名,以及所有未更改设置的现有免费用户——Training 和 Agent 爬虫在显示广告的页面上默认屏蔽,Search 保持允许。Cloudflare 的逻辑是:「广告意味着网站主希望真人到达并看到它——那是可货币化的东西,是业务的燃料。」

规则二(更具杀伤力):多用途爬虫将按最严格的规则执行。 如果一个爬虫同时承担 Search 和 Training 任务,而网站主屏蔽了 Training,那么该爬虫将被整体屏蔽——包括它的 Search 功能。

Cloudflare 官方博客明确点名了三家公司:「multi-purpose crawlers such as Googlebot, Applebot, and BingBot will be blocked by customers who have selected to block Training。」

这就是这场博弈的核心:Google 的 Googlebot 同时用于 Google Search、AI Overviews 和 AI Mode 以及 Gemini 训练。如果发布商想阻止 AI 训练,在 Cloudflare 的新规则下,Googlebot 的搜索爬取也可能被连带切断。

数字背后:爬虫的互联网已经来临

Matthew Prince 在公告中引用了两个关键数据:

  • 互联网流量中,非人类流量已超过人类流量——这一里程碑「原本预计明年才会出现」。
  • 超过 50% 的 AI 爬虫流量是在重复抓取未更改的页面——白费了发布商的带宽和算力。

Cloudflare 同期发布的《Content Independence Day 年度报告》显示,AI 训练已占其网络上爬虫请求的大多数(2025 年春季时仅为约 20%),而每日 AI Agent 请求量在过去一年增长了超过 1,700%。

TechCrunch 报道中,Prince 对 Google 的批评更加直接:「全球最大搜索引擎」掌握的网页内容数据「大约是其他 AI 公司的两倍」,因为发布商几乎不可能在不影响搜索排名的前提下拒绝其 AI 用途。

从「阻止」到「收费」:HTTP 402 的复活

与屏蔽政策同步推出的,还有让内容创作者获利的机制。

Pay Per Crawl(按爬取付费) 是 Cloudflare 的一项私测功能,它复活了一个几乎被遗忘的 HTTP 状态码:402 Payment Required。

工作原理:当 AI 爬虫请求付费内容时,Cloudflare 返回 HTTP 402 及 crawler-price 标头,标明价格。爬虫可以选择以 crawler-exact-price(接受定价)或 crawler-max-price(声明最高出价)回应。Cloudflare 作为交易记录商,汇总账单事件,向爬虫收费并分配给发布商。

底层基于 Web Bot Auth 协议:爬虫用 Ed25519 密钥对签名请求,Cloudflare 在边缘节点验证身份。这意味着无法冒充已注册的付费爬虫——欺骗在技术层面被堵死了。

Pay Per Use(按价值付费) 则更进一步:发布商不仅在内容被抓取时获得报酬,还在内容产生实际价值时获得报酬——例如当内容出现在 AI 搜索结果中。初批合作伙伴包括 Ceramic.ai 和 You.com。

Cloudflare 还宣布了 Monetization Gateway,允许网站主对任何网页、数据集、API 或 MCP 工具收费,通过 x402 开放协议以稳定币结算。

BotBase、Content Signals 与传递信任

除了政策和商业机制,Cloudflare 还发布了三项基础设施工具:

BotBase:面向 Enterprise Bot Management 客户的爬虫目录,按分类展示所有已知 Verified bot 及其行为标签(Search/Agent/Training/Transact/Data Collection 等),可直接复制检测 ID 用于安全规则。

Content Signals 扩展:在 robots.txt 中新增 use 参数,值可选 immediate(不存储)、reference(索引和链接,新默认值)或 full(总结和复现)。声明偏好,不直接阻断——但如果机器人滥用信号,将失去 Verified 状态。

传递信任 (Transitive Trust):利用 RFC 7239 的 Forwarded 标头表示爬虫背后的实际运营者,支持多层代理场景。例如 Forwarded: for="openai";use="reference"。这在 Cloudflare 覆盖的超 20% 网络域名上,构成了一套「信任可以携带,也可以失去」的激励机制。

这不是技术细节,是权力转移

Cloudflare 此举的本质是:将互联网基础设施层的权力直接嵌入 AI 数据权利之争。

在此之前,AI 公司与发布商之间的博弈主要通过 robots.txt(一份没有法律约束力的建议书)和私下授权谈判进行。发布商面对的是悬殊的权力不对称——要么放弃搜索流量,要么无偿被训练。

Cloudflare 的 9 月 15 日最后通牒改变了游戏规则。它迫使 AI 公司做出选择:要么拆分爬虫、实现透明,要么面临大规模的网络级阻断。对 Google 而言,这可能意味着必须将 Googlebot 拆分为纯粹的搜索爬虫和独立的训练爬虫——否则,大量 Cloudflare 托管网站将在屏蔽训练的同时,连带失去 Google 搜索的收录能力。

正如 Prince 所言:「现在互联网流量的大多数已非人类,我们必须走得更远、更快,才能让一个可持续的生态系统出现。」

9 月 15 日将是一个观察窗口:Google、Apple、微软是否会在这个截止日期前将它们的「多合一」爬虫拆开?或者,内容王国的独立战争才刚刚开始?

来源

  1. Your site, your rules: new AI traffic options for all customers — Cloudflare Blog
  2. Introducing pay per crawl — Cloudflare Blog
  3. Cloudflare's new policy pushes AI companies to pay for publishers' content — TechCrunch
  4. Cloudflare's AI Crawler Rules Can Block Googlebot — Search Engine Journal
  5. Cloudflare sets AI crawler deadline: separate search or be blocked — NBC News

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Pew 图表:AI 写作痕迹在 .com 域名网页中约占一成,在 .edu 与 .gov 域名中仅约 1%

    ChatGPT 发布后超三分之一网页带 AI 写作痕迹:Pew 的 49 万页测量

    数据 · 2026-08-22

  • iPhone 上的 Siri 提示气泡,示意 Apple 正在为 AI 版 Siri 接入新闻内容

    Apple 拟按内容「使用次数」付费:Siri AI 内容授权的计量难题

    数据 · 2026-08-13

  • 一名身着商务装的人与身旁透明的人物轮廓,四周环绕聊天提示词

    厂商 AI 使用报告漏掉近一半真实对话,独立测量挑战「工作用途」叙事

    数据 · 2026-08-20

  • Seedance 2.0 生成的 AI 视频截图:汤姆·克鲁斯与布拉德·皮特在屋顶打斗

    MPA 与字节跳动达成首个 AI 版权协议,护栏细节未公开

    数据 · 2026-08-17

  • Reuters 为 Anthropic 数据留存政策报道配发的编辑插图:机械手、键盘与 Anthropic 标识

    OpenAI 推零留存安全监控,Anthropic 的 30 天数据留存政策松动

    数据 · 2026-08-21

  • OpenAI 首席执行官 Sam Altman 在美国参议院商务委员会就 AI 竞赛举行听证时作证(资料图)

    企业 AI 的领先并不黏:Fable 5 卖不动,半价的 Sol 帮 OpenAI 反攻

    数据 · 2026-08-20

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS