8 月 19 日,OpenAI 发布开发者博客《Codex as a platform》,把驱动 Codex 的执行框架 Harness 明确作为开源平台对外推出:Codex CLI、app-server 和官方 SDK 三个组件在 github.com/openai/codex 下以 Apache-2.0 许可发布。这则消息的新闻点不在于"OpenAI 又开源了一个东西"——Codex CLI 早在 2025 年 4 月就已开源——而在于它同期公开的一个数字:同一个 GPT-5.6 Sol 模型,只改变两项 harness 设置,在 ARC-AGI-3 上的分数就从 13.3% 升到 38.3%,输出 token 降到原来的六分之一。
开源的不是模型,而是模型的"运行环境"
一个能持续自主工作的 agent,需要的不只是一次模型推理。它要理解任务、跨多轮保持上下文、查看信息、调用工具、报告进度、失败后恢复、必要时请求人类批准——把这一整套执行系统包起来的,就是 harness。OpenAI 对它的定义很直接:harness 负责管理对话状态、流式执行、工具调用,执行配置好的沙箱与审批策略,并把工作跨轮次延续下去。
这次开源分成三个入口。codex exec 面向脚本、CI 或一次性后台任务,跑一个受约束的 agent 工作流并返回结构化输出;官方 Codex SDK 提供程序化接口,供应用代码启动、恢复或流式接收 Codex 任务;app-server 则通过一套文档化的客户端协议暴露能力,让应用创建线程、启动轮次、接收事件、处理审批请求。Harness 本身用 Rust 写成(仓库里的 codex-rs 目录)。
边界必须写清:OpenAI 开放的是 harness 与集成层,不是模型。官方原话是"The open-source layer is the harness and integration surface; model access and managed services remain separate"——GPT-5.6 Sol 的权重没有开源,模型访问与云托管服务仍是闭源、收费的。也就是说,开发者拿到的是"让模型变成 agent 的骨架",模型本身依然只能通过 OpenAI 的 API 或订阅来调用。
13.3% 到 38.3%:两项设置如何让同一个模型接近翻三倍
最能说明 harness 分量的,是 OpenAI 在 7 月 29 日那篇《How enabling two settings tripled our scores》里记录的一次对照实验。ARC-AGI-3 是 ARC Prize 推出的 2D 交互游戏基准,模型进入陌生的游戏环境,没有规则说明,要靠试错推断机制,评分用的是 RHAE(相对人类动作效率),同时衡量通关率与动作效率。
GPT-5.6 Sol 在 ARC 官方提供的通用 harness 下只拿到 13.3%。问题不在模型"不够聪明"——OpenAI 发现官方 harness 有两个致命设计:一是每次动作后私有推理被丢弃,模型每走一步都像失忆一样重新猜游戏规则;二是用滚动截断处理超长上下文,历史一长,早期的动作连同经验一起被丢掉。模型不是学不会,是"记不住"。
OpenAI 只改了两项设置。第一项是保留推理(retained reasoning):模型动作前的私有思考链被保留在对话历史里,于是它不必每步从零解释局面,学得更快、每步想得更少。第二项是上下文压缩(compaction):对话过长时用摘要压缩代替直接截断,把已学到的游戏经验带过更长的时间跨度。两项叠加,同一模型在公开集上拿到 38.3%,输出 token 降到约六分之一。
这里有两层边界不能省。其一,13.3% 是"ARC 官方通用 harness"下的分数,不是 OpenAI 自己优化前后的对比——它证明的是"harness 选择"决定成绩,而非"OpenAI 把自家 harness 改进了三倍"。其二,即便升到 38.3%,仍低于 OpenAI 估计的人类测试者平均约 48% 的水平。这个数字的价值在于揭示机制,不在于宣告模型"逼近人类"。
一周之内,两个团队得出同一个结论
这条消息单独看是一则开源新闻,放到本周语境里则是同一个命题的第二块拼图。8 月 21 日,Nvidia 研究团队宣布其智能体架构 AVO 在 ARC-AGI-3 公开集拿到 100.00 的 RHAE 分数,清完 25 个环境、183 个关卡——而它底层的模型是 Anthropic 的 Claude Opus 5,这个模型被 ARC Prize 单独评测时只拿到约 30%。
两个团队用同一个基准、在两个方向上说出了同一句话:评测一个模型,不等于评测一个 agent。OpenAI 从 13.3% 到 38.3%,靠的是改 harness 设置;Nvidia 从约 30% 到 100%,靠的是换掉整套 agent 架构(持久记忆加监督循环)。Nvidia 在博客里写得更直白:"The model matters, but the model is not the entire agent."(模型重要,但模型不是 agent 的全部。)
这个巧合本身就值得标注:当 OpenAI 和 Nvidia 在同一个星期、用同一个基准,独立地论证"系统设计决定长期自主能力"时,行业讨论的重心正在从"谁的模型分数更高"滑向"谁的 agent 运行时更好"。竞争对标也清晰起来——Nvidia 的博客顺带点明,VISTA 系统分别用 Claude Opus 5 跑在 Claude Code、GPT-5.6 Sol 跑在 Codex 上,Claude Code 与 Codex 正是这一层的直接对位产品。
从编码工具到报税流程:harness 已经在生产里跑
OpenAI 用几个已经上线的案例说明,这套模式不局限于写代码。据官方博客,Cisco 在 Cloud Control 的 App Builder 里用 Codex SDK 构建自定义工具;Thrive Holdings 与 Crete 用 Codex 搭了一个报税工作流,把税务从业者的反馈直接纳入 agent 流程,试点处理了 7000 份报税单,准备时间减少约三分之一;GitHub 与 JetBrains 则把 Codex 作为 agent provider 接进 JetBrains IDE。OpenAI 自己也做了个示例应用 Relay,把 agent 放在一个虚构的物流仪表盘旁,任何有后果的写操作都要经过人工批准。
这些案例的共同点,不是"agent 能写代码",而是把 agent 嵌进用户已经熟悉的产品和工作流——安全分析师有调查队列,客服有账户历史和内部文档,产品经理有任务看板。harness 负责底层循环,产品继续拥有自己的界面、数据与审批流程。这一部分证据来自 OpenAI 官方博客,属于厂商自述,未经独立审计,但其意义在于说明"harness 作为平台"的定位已经从概念变成了可观察的部署实践。
判断:把脚手架变成生态,把模型变成后端
OpenAI 这一步的战略含义,是护城河位置的迁移。过去一年,前沿实验室之间的差异化主要发生在模型权重上;如今,把模型变成可持续自主 agent 的执行脚手架,正在成为新的竞争层。OpenAI 用开源抢占这一层的标准,同时保留模型与托管服务的闭源和收费——脚手架开源、模型收费,这是"把开发者吸进生态、把收入留在模型"的组合。
对开发者和企业,这制造了一个新的 build-or-adopt 选择题:自建编排层、用厂商闭源平台,还是站在 OpenAI 已经打磨多年的开源 harness 上。对 OpenAI 自己,它让渡了 harness 层的独有性,换来的是这一层的事实标准地位——前提是开发者真的愿意放弃通用聊天窗口,把 agent 拆成组件嵌进自己的产品。
仍需观察的变量有三:其一,38.3% 仍低于人类基线,harness 优化的红利有上限,它不能替代模型能力本身;其二,开源组件与闭源 Codex 产品之间的确切边界并不完全透明,官方只说"模型访问与托管服务仍独立",内部是否仍有闭源组件未公开;其三,企业案例与关键数字均出自 OpenAI 官方,缺少独立第三方对 7000 份报税单或 Cisco 部署的复核。这些不确定性不推翻"脚手架正成为护城河"的判断,但限定了它的证据强度。

