8 月 5 日,Meta 发布了其首款编码 Agent——Muse Code(beta)。这款终端工具由新模型 Muse Spark 1.2 驱动,面向 macOS 和 Linux,能在大规模代码库中规划改动、编写代码并验证结果。CEO Mark Zuckerberg 和 AI 负责人 Alexandr Wang 共同宣布了这一产品。
但真正让这次发布区别于又一轮"大厂入局"的,不是技术架构,而是定价表里的第二列。
双轨定价:标准价格与"贡献者价格"
Muse Code 提供两种付费方案,使用的是同一个模型。标准 pay-as-you-go tier 定价为每百万输入 token $1.25、每百万输出 token $4.25,缓存输入 $0.15,与当前主流编码模型的 API 定价处于同一区间。
贡献者 tier(contributor tier)的定价则完全不同:每百万输入 token $0.10,每百万输出 token $0.20,缓存输入 $0.002。输入价格约为标准 tier 的十二分之一,输出价格约为二十一分之一。Wang 在接受 CNBC 采访时将其描述为"比 pay-as-you-go tier 便宜十倍以上"。
代价是:选择贡献者 tier 的开发者需要允许 Meta 使用其 prompts 和 completions 来训练模型。标准 tier 不包含这一许可。Quartz 报道称,Meta 同时开始接受企业客户的零数据留存(zero-data retention)请求——企业用户如果不想贡献数据,可以走标准 tier 或申请数据隔离。
Forbes 的分析直指要害:"Meta 不是定了一个折扣价格,而是贴出了一份收购你源代码的要约,支付的货币是算力。"
架构设计:持久 Agent 与可恢复运行时
Muse Code 的运行时设计有几个值得注意的选择。不同于按任务生成子 Agent 随即销毁的模式,Muse Code 启动后会维持一组异步后台 Agent(async background agents),它们在整个 session 中持续存活,主动收集上下文、执行辅助工作并择机向主 Agent 报告。Meta 称这种设计避免了重复的信息收集,在多步骤复杂任务上能降低延迟和人工干预。
另一个设计是本地化的 append-only 事件日志。每一次模型调用、工具执行、人工审批和代码编辑都被追加记录到这一日志中。Meta 将其称为"replay-exact 且 restart-safe":崩溃后 Agent 可以从断点精确恢复,让长时间运行的任务不会因单次故障而前功尽弃。配套的三项内置技能——/plan(生成审批门控计划)、/grill(压力测试计划)和 /goal(推进目标完成)——构成了一条从规划到验证的工作流。
并行执行方面,Muse Code 在隔离的 worktree 中派生子 Agent 并行处理独立任务。Zuckerberg 在社交媒体上透露,测试中 Muse Code 曾同时为一个游戏构建了六个功能模块,"互不冲突"。
Muse Spark 1.2:与 Agent 联合训练的模型
Muse Spark 1.2 是 Muse Spark 1.1 的编码专项升级版。Meta 研究团队大幅增加了编码任务上的训练算力,扩展了训练环境的多样性。最重要的技术决策是模型与 Agent 的联合训练(co-training):训练过程中整合了 Muse Code 的工具集,包含了 rejection-sampled 的 Agent 执行轨迹,并针对目标分解、上下文压缩和子 Agent 调度做了配方优化。
训练还覆盖了长周期编码任务,包括整库生成、大型端到端项目和自动研究(auto-research)。模型在此过程中学习使用规划来排列工作、用目标条件化来维持方向、用上下文压缩来保留推进所需的知识。
Meta 同时使用了一个自改进循环:让 Muse Spark 1.1 生成高难度编码环境和指令遵循模板,然后对候选方案打分——成功的方案构成 Muse Spark 1.2 的可扩展训练数据集。这一方法绕过了合成数据常见的"自己教自己"退化问题,因为代码领域有客观的验证标准——编译是否通过、测试是否跑通。
在 Benchmark 方面,Meta 公布了 Terminal-Bench 2.1(89 项任务)、DeepSWE v1.1(113 项任务,覆盖 91 个仓库和 5 种语言)和 Meta Internal Coding Bench(440 项来自内部 PR 的任务)上的成绩,与 Grok 4.5、Claude Opus 5、GPT-5.6 Terra、Gemini 3.6 Flash 和 Kimi K3 等模型及各自 Agent 产品做了对比。所有测试在隔离的 Daytona 云端沙箱中执行。Forbes 指出,Meta 目前以图片形式发布 Benchmark 结果,尚未提供完整的方法论文档,独立验证仍然欠缺。
Meta 还公布了一项 GPU 内核优化案例研究:Muse Code 在 NVIDIA Hopper GPU 上对 KDA 和 MLA 内核进行了超过 1000 次工具调用的迭代优化,最长运行了 24 小时。Agent 持续在提供的 baseline 上取得显著改进——例如针对 MLA,模型设计了一个双内核 Triton pipeline,通过复用共享 KV latent 同时作为 K 和 V 来优化性能。
数据战略:代码交互数据的稀缺性与可验证性
理解贡献者 tier 的关键在于理解训练数据的质量瓶颈。公开互联网已被反复爬取,数据授权协议昂贵且缓慢,合成数据在模型主要从自身产出中学习时会出现分布漂移。真正稀缺的是人类在实际约束下做真实工作时产生的数据。
代码在这个问题上占据特殊位置,因为它是可自动验证的。代码要么编译通过要么不通过,测试要么跑通要么失败,reviewer 要么批准要么驳回。相比之下,一份客户服务对话或合同谈判记录没有编译器可以判定其对错——反馈可能在数周后以投诉的形式出现,甚至根本不会出现。
这意味着每一次贡献者 tier 上的编程 session 产生的不是一段文本,而是一个"问题-尝试-裁决"的完整三元组,发生在真实仓库、真实依赖和真实 bug 的上下文里。从 GitHub 爬取的公开代码只能给模型看到最终提交;而一个在开发者终端里运行的编码 Agent 能捕获推理过程、失败尝试和修正路径。
这正是 Facebook 曾经做过的事情——以免费服务换取三十亿用户的行为数据,然后用这些数据构建了全球最大的广告业务。Muse Code 将同样的结构应用到了互联网上价值最高的劳动者群体,并且这次 Meta 是付钱请他们参与。
时间点同样值得注意。Meta 在 7 月底公布的 Q2 财报显示,营收 $608 亿超预期,但 EPS $6.18 远低于共识预期的 $7.14。自由现金流从去年同期的 $85 亿骤降至 $7.84 亿。2026 年资本支出指引高达 $1300-1450 亿。股票随即下跌约 8%。在这样的财务压力下,将一部分算力转化为原本需要授权、爬取或制造的训练数据,不是营销姿态,而是一种资源再配置。
竞争位置:以价格为杠杆
Wang 在接受华尔街日报采访时明确表示,Muse Code 的竞争力来自价格而非能力。这一定位有其合理性。与 Anthropic 的 Claude Code(Claude 4 Sonnet 定价 $3/M 输入、$15/M 输出)和 OpenAI Codex 相比,Muse Code 的标准 tier 已经具有价格优势,而贡献者 tier 则将价格压低了超过一个数量级。
Muse Spark 1.2 同时通过 Meta Model API 和 OpenRouter 平台提供,扩大了分发渠道。Muse Code 目前仅支持 macOS 和 Linux,安装只需一条 curl 命令。
但 Meta 进入的是一个已经有明确领导者的市场。Anthropic 和 OpenAI 的编码产品已经销售了一年,Cursor 和 GitHub Copilot 分别占据了 IDE 和编辑器内编码辅助的不同位置。Muse Code 选择以终端 Agent 的形态切入——这是一个更接近专业开发者日常工作流、但也更需要用户主动学习和适应的形态。
边界与待观察的问题
Muse Code 目前处于 beta 阶段,实际性能和稳定性需要更多独立验证。Benchmark 结果以图片发布而非完整方法论,这也限制了外部对其声明的评估。贡献者 tier 的数据使用条款细节——包括数据保留期限、去标识化措施、是否对开源项目与闭源项目区别对待——Meta 尚未完整披露。
更根本的问题是:用折扣价格换取训练数据的模式在开发者群体中能否规模化。Facebook 的社交数据模式建立在消费者对隐私成本的低感知之上;而专业开发者对代码数据的敏感度远高于普通用户对社交数据的感知,尤其是在涉及私有代码库和商业机密的场景下。贡献者 tier 的采用率将是检验这一假设的第一个硬指标。
编码 Agent 是当前 AI 商业化图景中少有的能形成闭环验证的领域——代码可以被编译器和测试套件自动检验,用户具备审查每一步的专业能力。Muse Code 的发布确认了一件事:在这个领域,高质量交互数据的价值已经超过了 API 调用的边际收入。Meta 选择用定价表来兑现这一判断,而其他编码 Agent 厂商现在需要回答同一个问题:一个开发者的工作 session 值多少钱。

