Cloudflare 做了一套开源的企业 AI 工作平台,叫 Cloudflare OS。它给每个员工一个浏览器里的 Agent 工作空间,预装公司自己的知识库、流程规范和工具连接,可以从一段对话开始,逐步长成文档、幻灯片、数据看板,乃至一个带前端界面和持久状态的完整应用。

这个项目在 Cloudflare 内部已经跑了三个月,覆盖了工程之外的数千名员工——销售用它做客户演示文档,运营用它自动化重复任务,财务用它构建小型数据可视化工具。现在 Cloudflare 把第二版完整重写的代码放到了 GitHub 上(cloudflare/cloudflare-os),任何组织都可以部署到自己的 Cloudflare 账户中,改造成专属的内部平台。
这不是传统意义的操作系统
Cloudflare 自己用"操作系统"这个词做了两层类比:一层是给公司用的 AI 生产力底座,让安全团队能放心让非技术人员自由使用 Agent;另一层是技术层面的工作负载管理——内核、驱动、进程、可执行文件、权限控制,这些传统 OS 的概念在这个系统里都有对应的实体。
| 传统操作系统 | Cloudflare OS |
|---|---|
| 内核 (kernel) | workshop-backend 包 |
| 设备驱动 (device drivers) | Gatekeeper 模块 |
| Shell | workshop-frontend |
| 进程 (processes) | Gadgets(小型应用) |
| 可执行文件 (executables) | Blueprints(应用模板) |
| 用户 | 用户 |
| 访问控制列表 (ACL) | 共享权限 |
唯一没有传统对应物的是 Agent 本身。Cloudflare 认为 Agent 不能简单当作用户对待——它必须对人类用户负责,同时拥有自己的受限权限。Agent 通过即时编写和执行代码片段来完成工作,而理想的安全模型是基于能力的 (capability-based),而非传统的访问控制列表。
Gadgets:每个人运行自己的应用副本
Cloudflare OS 的核心概念叫 Gadget——一种小型个人应用。当你让 Agent 生成一个幻灯片时,系统为你创建一个独立的幻灯片应用实例,运行在和其他人隔离的沙箱里。
这个设计带来两个直接效果。第一,安全性从根本上改变了:幻灯片应用不可能因为自身漏洞泄露你的数据,因为所有访问都由 Cloudflare OS 的沙箱层控制。第二,任何人都可以自由修改应用代码——如果幻灯片工具缺一个功能,直接让 Agent 加上就行,不需要提交工单等待开发排期。
每个 Gadget 都是完整的全栈应用,包含客户端代码、服务端代码、API 和持久状态。应用默认私有,但可以像文档一样分享给同事。客户端和服务端通过 Cap'n Web RPC 通信——这是 Cloudflare 开源的轻量级对象能力 RPC 框架,方法定义在服务端后,客户端直接当本地函数调用,Agent 也能调同样的接口。
Gatekeepers:能力安全模型
Gatekeeper 是 Cloudflare OS 安全架构的核心。它是一段运行在 Cloudflare Worker 上的服务特定代码,坐在 Agent 和外部系统之间。每个 Gatekeeper 针对一个外部服务(GitHub、Jira、Google Drive 等),理解该服务的 API、资源和可用操作。
传统做法是把 API Key 交给 Agent,这既危险又难审计。MCP Server 改进了这一点——凭证留在 MCP Server 内,只暴露一组工具。但 MCP 只管 Agent 能调哪些工具,不管 Agent 读到了什么数据。Agent 可以跨系统组合信息,把敏感数据写入限制较弱的系统,或者通过应用分享给不该看到的人。
Gatekeeper 解决的是"数据流到哪里"的问题:
- 初始访问控制:给 Agent 整个 GitHub 账户权限太宽。Gatekeeper 可以限制它只能访问某个仓库、只能读 Issue 不能读源码、对特定字段脱敏、设速率限制、合并 PR 前需要人工审批。
- 观察日志:平台记录 Agent 读取的每一个资源,这些观察记录永久附着在 Agent 及其产物上。当另一个人尝试打开这个工作空间或查看 Agent 产出时,Gatekeeper 会检查这个人是否对被观察资源有访问权限。
- 策略传播:一条敏感数据的读取记录可以阻止 Agent 向某些来源写数据、邀请新协作者、把工作交给另一个 Agent,或发起外部请求。
每个 Gatekeeper 都是一个独立的 Worker。在当前实现中,Gatekeeper 和 OS 实例部署在一起,但 Cloudflare 的设想是未来 Gatekeeper 服务可以独立部署和维护。
同步审批的替代方案
一个工程上值得关注的设计是 Gatekeeper 的异步审批机制。
传统 human-in-the-loop 要求 Agent 在需要审批时停下来等人类确认。这很烦人——你给 Agent 一个任务,去倒杯咖啡回来,发现 Agent 卡在第一步的审批上什么也没做。结果就是人们经常选择"自动批准"或跳过权限检查,显然不安全。
Gatekeeper 的做法是:当 Agent 要执行需要审批的操作时,Gatekeeper 先在本地模拟执行结果,告诉 Agent 操作已完成,如果 Agent 回读结果就返回模拟数据。Agent 可以继续排队更多操作。等 Agent 跑完,用户可以批量批准或拒绝这些操作,而且可以在方便的时候做。
底层基础设施:Dynamic Workers 和 Facets
Cloudflare OS 大量使用 Cloudflare Workers Runtime 的前沿特性,其中几个是专门为这个项目新增的:
- Dynamic Workers:轻量 V8 isolate,毫秒级启动,几 MB 内存占用,冷启动比容器快约 100 倍。2026 年 4 月进入公测。每个 Gadget 的服务端代码都作为 Dynamic Worker 按需加载。
- Durable Object Facets:每个 Gadget 作为 Durable Object Facet 实例化,拥有独立的 SQLite 数据库,与管理它的 Cloudflare OS 运行时隔离。这使得多用户实时协作天然可用——每个 Gadget 都有持久状态,多人编辑时通过 Durable Object 同步。
- Cap'n Web:Cloudflare 开源的对象能力 RPC 系统。服务端方法可以像本地函数一样从客户端调用,Agent 调同样的接口。低样板代码意味着 Agent 很容易与之交互。
- Code Mode:Agent 使用 Code Mode 完成工具调用——通过编写和即时执行代码片段来使用工具,而不是传统的 JSON function calling。
服务端代码运行在禁用全局出站网络的 Dynamic Worker 中。客户端代码运行在浏览器沙箱帧中。两者都不能直接访问互联网,除非通过你显式提供的能力绑定。
模型无关与成本控制
Cloudflare OS 可以接入任何模型。每次推理调用都经过 Cloudflare AI Gateway,组织可以集中决定哪些模型可用、每个任务用哪个模型。不是所有任务都需要最贵的模型——AI Gateway 让昂贵的前沿模型只处理最难的工作。
每个请求归属到发起的个人、团队或工作空间。管理员可以看到推理花费用在哪、设置预算和速率限制、设定达到限制后的行为。
MCP Server Portals
Cloudflare OS 支持组织已有的 MCP Server 通过 MCP Server Portals 接入。这提供了一个渐进式迁移路径:如果你已经在内部部署了 MCP Server 连接各种系统,不需要重写——直接通过 Portal 接入,Cloudflare OS 的安全层会叠加在其上。
开源与部署
Cloudflare 发布了两个仓库:核心 cloudflare/cloudflare-os 和示例部署 cloudflare/cloudflare-os-starter。后者模拟 Cloudflare 内部的使用方式,包含配置、自定义 UI、内部集成和部署管线。
本地快速体验只需 pnpm run-local,整个栈在 wrangler 和 workerd 上跑起来,访问 localhost:8787。生产部署到自己的 Cloudflare 账户后,可以使用自己的 Access 策略、AI Gateway 配置、数据和集成。
因为整个系统构建在 workerd(Cloudflare Workers Runtime 的开源版本)之上,理论上也可以在自己的服务器上运行,不绑定 Cloudflare 云。
当前状态与路线图
仓库 README 明确标注这是"早期访问"版本——v2 是一次完整重写,能力已经相当强,但仍有粗糙之处。Cloudflare 正在推进的方向包括:将 Cloudflare OS 作为完全托管的产品纳入 Cloudflare 仪表盘、为开发工作流添加容器支持、以及把工作空间引入 Slack 等聊天工具。
Cloudflare 的战略合作伙伴 Presidio 和 Happy Cog 提供定制化部署服务,帮助组织围绕自身运作方式定制 Cloudflare OS——策划共享技能和机构知识上下文、构建自定义界面、通过 Gatekeeper 和 MCP Server Portals 连接内部系统。
技术层面的意义
Cloudflare OS 的架构选择值得拆解。它没有走"给 ChatGPT 接一堆 MCP Server"的路线,而是从底层重新设计了 Agent 与组织资源的交互方式:
- 能力安全替代凭证传递:Agent 不再持有 API Key,而是通过 typed binding 获得对特定资源的受限访问。凭证完全隔离在 Agent 和生成代码之外。
- 观察追踪替代调用日志:不只记录 Agent 调了哪些工具,而是记录它实际看到了什么数据,并在数据传播链上施加策略约束。
- 沙箱应用替代 SaaS 调用:每个用户的应用副本独立运行,安全边界由平台而非应用自身保证。
- 异步审批替代同步阻塞:Gatekeeper 模拟让 Agent 不阻塞,人类批量审批。
这些设计决策指向一个问题:当 AI Agent 成为组织中持续运行的执行者时,传统的基于凭证和角色的访问控制是否还够用。Cloudflare OS 的回答是能力安全模型——Agent 的每个能力都是显式授予、可审计、可撤销的。