8 月 27 日,Anthropic 开放 Model Hardware Standard(MHS)的研究预览——一套让 AI agent 安全操作物理设备的共享规范,首批面向科研实验室与先进制造企业。MHS 瞄准的不是让单个模型更聪明,而是把「agent 操作物理世界」的瓶颈从模型能力转移到互操作层:它用一个标准驱动加 read/write 原语,把显微镜、液体处理机、机械臂这类原本互不通信的设备,变成 agent 可以直接发现、理解和读写的资源。Anthropic 称它把设备集成时间从「数周乃至数月」压缩到「数小时甚至数分钟」;但这一数字,连同下文所有性能数据,都出自 Anthropic 与合作方的自述,标准本身尚未开源。
把异构设备变成 agent 能读写的资源
MHS 解决的是一个比「让 AI 更聪明」更靠下、也更枯燥的问题:实验室或工厂里的设备各有各的编程接口,设备之间不通信,要它们协同通常需要专人写一次性集成。MHS 的办法是引入一个标准化驱动——一段在操作系统与硬件设备之间做翻译的软件——用一组极简原语(「读」,例如取温度;「写」,例如设温度)让任何带可编程接口的设备都能理解和执行。每个设备以标准格式变得可发现,设备和 agent 可以在网络上互相找到对方,而不需要中间再垫一个定制的「翻译」程序。
这层抽象还补上了模型单靠代码看不到的那部分信息。设备不少关键特性写在纸质手册里、或者只存在于操作者脑中,比如机械臂的重量——它直接决定操作是否安全。MHS 的驱动带标签系统,用户可以用自然语言把这些信息写进去,或者跟一个会「盘问」你硬件配置的 agent 聊天录入;驱动据此自动生成一份参考文件,说明这台设备能测什么、能调什么、强制执行哪些安全限制。CNBC 用「像一根 USB-C 线」类比它的作用——把信息在设备之间的传输方式标准化。Anthropic 负责有益部署(Beneficial Deployments)的 Elizabeth Kelly 说:「我们为科学造了它,来展示 AI 的潜力,但它对企业和工业同样有巨大好处。」
设备连上、agent 也理解设备之后,控制走三条通道:MCP、命令行接口、代码文件(API)。三者配合,可以用一行代码编排多台设备。长任务或需要比在线推理更快执行的操作,agent 会把多台设备的驱动命令串成代码文件,让设备自行执行,而不是每一步都靠模型推理。Anthropic 描述了一次观察:Claude 调整激光、通过摄像头看结果、再调整,反复几次摸清因果,然后把学到的东西写成确定性脚本——对齐激光这件事从此变成一条命令。
不是新的机器人 demo,而是 agent 侧的互操作层
把 MHS 放进现有技术版图,它的新意不在「能控制设备」本身,而在它站在哪一层。工业自动化早有 OPC UA 这样的语义互操作标准,负责设备级的数据交换与信息建模;OPC 基金会今年 4 月还宣布要把 430 多套 Companion Specification 转成 RAG、MCP 可用的 AI 友好格式,理由是让 OPC UA 成为「agentic AI 与工业自动化世界之间的语义层」。也就是说,工业侧正在把成熟标准往上接 agent。MHS 从相反方向做同一件事:从 agent 出发,往下定义一个「设备如何被发现、被描述、被安全操作」的接口。
这决定了 MHS 与 ROS、OPC UA 不是替代关系。ROS 是机器人软件框架,OPC UA 是设备级通信与信息建模,MHS 是 agent 面向设备的抽象层——把设备的能力描述、物理约束和安全限制打包成一个 agent 可以直接读写的资源。两者最终要接的是同一处:让 AI 可靠地理解并操作物理设备。但 MHS 赌的是「模型无关」的共享规范能跨厂商成立,而这个「模型无关」目前只是设计目标,公开验证过的只有 Claude 系。
首轮案例的数字,都要打上「自述」的标记
Anthropic 随发布给出了一批早期案例,它们的证据强度应当分开看。卡内基梅隆大学(CMU)用 MHS 跑序列稀释的剂量-反应实验,「比之前快约三倍」,agent 编排了液体处理机、读板器、机械臂和监控摄像头,这些设备分布在三台接口互不兼容的电脑上。量子计算公司 QuEra 让 agent 接管了中性原子量子计算机里激光系统的部分控制,开发出的控制器能在 99.3% 的情况下无需人工干预地恢复激光「锁定」——即激光与原子相互作用必须保持的超高频率精度。HHMI Janelia 的研究人员用 MHS 统一了一台此前依赖七套不同厂商程序、没有共享接口的显微镜装置。
同一批预览里,Genentech 用 MHS 跑通了 BCA 蛋白定量实验的自动化概念验证,需协同液体处理机、机械臂和读板器;华盛顿大学 Baker 与 Pinglay 实验室的一名博士生用它搭了远程监控仪表盘,以及一个 AI 监督、会自己把握终止时机的 qPCR 流程。这些案例有两个共同点:全部来自 Anthropic 与合作方的自述,没有独立审计或第三方复现;它们衡量的是「集成和编排」,不是「agent 的通用科学能力」。把集成时间从数周压到数小时是 MHS 最核心、也最可信的卖点,因为它是标准层的直接收益;而 3 倍提速、99.3% 恢复率依赖具体实验设置,在标准开源、外部能够复现之前,只能当作合作伙伴的个案汇报。
物理推理的短板,划出了当前能力的边界
Anthropic 自己把边界写得很清楚:Claude 通过文本和图像学习物理世界,其空间与物理推理仍有局限,需要专家监督。一个具体例子是,Genentech 处理蛋白质样本时,研究人员不得不引导 Claude 认识到「样本起泡导致的错误是物理失败,而不是软件 bug」,只能靠相应的物理纠正来解决。这比任何机器人 demo 都更能说明问题:MHS 解决的是「怎么让 agent 安全地够到设备」,还没有解决「agent 是否理解真实物理世界」。
另一个硬边界是设备本身:MHS 目前只对「带可编程接口」的设备有效,对那些没有编程接口的设备,Anthropic 正在与制造商合作把驱动直接做进硬件。所以现在这个阶段是研究预览,不是生产协议。Anthropic 用预览期换三样东西:与合作方共建安全评测、完善针对物理世界误用的防护、以及在开源前打磨标准;开源后它会一并发布预览期的发现,作为安全部署指南的一部分。下一阶段的接口扩展已经排了队:Hugging Face 将在机器人库 LeRobot 里加入 MHS 支持,树莓派在相机 MHS 驱动测试成功后,正把集成铺到多款产品上。
标准竞赛,而非能力竞赛
把 MHS 放回具身智能的竞争版图,它的站位很明确:当 Figure 在众包真实世界数据、其他玩家在卷人形机器人本体与运动能力时,Anthropic 选的是先定义「agent 如何安全操作既有设备」这一中间层,并借 MCP 生态、LeRobot 和树莓派这些支点去放大标准的覆盖面。但它目前仍只是一个研究预览——性能数据出自自述、规范未开源、「模型无关」未经验证、物理推理依赖人工纠错。对从业者而言,下一个可观察节点很具体:Anthropic 何时开源 MHS、开源时发布的评测发现能否被独立复现,以及 Claude 之外的 agent 是否被公开验证能跑通同一套驱动。