AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Prentis 融资 1 亿美元:32B 小模型在 computer use 赛道挑战 GPT-5.4

今天 · 共 2,980 字

模型
Getty Images / TechCrunch

由 LinkedIn 联合创始人 Reid Hoffman、Zynga 创始人 Mark Pincus 和连续创业者 Ritankar Das 联合创立的 AI 研究实验室 Prentis,正在以 10 亿美元估值寻求 1 亿美元融资。这家公司成立仅三个月,核心产品是一个 32B 参数的 computer use 模型 Hive-32B。Prentis 声称它在 WindowsAgentArena 和 ScreenSpot-v2 两项 benchmark 上超越了 OpenAI 的 GPT-5.4 和 Anthropic 的 Claude Opus 4.6,单任务成本约为前沿 API 的十分之一。

这些数字来自 Prentis 的 pitch deck,TechCrunch 获取了其中内容但未独立验证 benchmark 结果。融资尚未完成,客户名称也未被披露。

32B 凭什么挑战大模型

Prentis 的核心论点是:大模型在 computer use 任务上存在结构性浪费。一个 32B 模型如果仅在特定工作流中训练——比如处理保险理赔、自动化海关退税例外——就不需要通用推理能力来解决它永远不会遇到的问题。Prentis 声称通过在实际客户环境中直接训练模型来获取这种效率。

这与微软的做法形成了直观对比。微软研究院的 Fara-7B 同样走小模型路线,7B 参数即能在 WebVoyager 上达到 73.5% 的任务成功率,超越以 set-of-marks 方式运行的 GPT-4o(65.1%)。微软 Fara 团队的核心方法是通过自动化数据生成管线,以每个验证轨迹约 1 美元的成本生产训练数据,而非依赖昂贵的人工标注。

Prentis 没有公开其训练方法和数据管线的技术细节,因此无法判断其效率优势究竟来自模型架构创新、训练数据质量还是 benchmark 过拟合。

Benchmark 声明的边界

WindowsAgentArena(WAA)是微软于 2024 年发布的 Windows 桌面 agent benchmark,包含 150 余项任务,覆盖文档编辑、网页浏览、系统设置、编程和媒体消费等 11 个领域。在原始论文中,最佳模型仅达到 19.5% 的任务成功率,而人类基线为 74.5%。该 benchmark 的一个关键特点是支持在 Azure 上大规模并行评估——数百个 agent 可同时运行,将原本需要数天的评估压缩到约 20 分钟。

ScreenSpot-v2 则是一个 GUI grounding benchmark,测试模型将自然语言指令映射到屏幕像素级目标控件的能力。这与端到端任务完成(WAA 的评估方式)是不同的维度:定位正确按钮只是完成任务的前提条件之一,还需要规划、错误恢复和跨应用协调。

Prentis 在这两项 benchmark 上的表现需要放在更大的评估格局中看待。2026 年 6 月 26 日,OSWorld 基准的开发者发布了 2.0 版本,将任务难度大幅提升。此前 Claude Sonnet 4.6 在 OSWorld 上已达到 72.5%——接近人类水平——但在 OSWorld 2.0 上,最佳模型跌回 20.6%。这说明 computer use benchmark 的难度天花板正在快速抬升,任何在旧版 benchmark 上的领先优势都有保质期。

TechCrunch 明确表示未独立验证 Prentis 的 benchmark 结果,Prentis 也未公开足以让外部研究者复现对比的技术材料。在当前阶段,这些声明应被视为 Prentis 自己提供的、用以支撑融资叙事的内部数据。

收入预期 vs 确认收入

Prentis 的商业故事同样需要拆分。TechCrunch 报道,Prentis 已签署价值最高 5000 万美元的合同,投资者材料预测 2026 年第三季度年化 run rate 为 7500 万美元。但这些数字的构成方式与传统的 SaaS 收入有本质区别。

Prentis 的收费模式是取得客户通过自动化节省成本的 20%。这意味着 7500 万美元的预测取决于:(1) agent 实际产生了多少节省;(2) 节省是否可持续且可量化;(3) 客户是否认可计算结果。Pitch deck 中将这些数字描述为"依赖于性能表现并取决于最终执行"。这是一种高度条件化的收入模型——如果 agent 的表现不达预期,收入可以直接归零。

Ritankar Das 此前通过其控股公司 Titan 创办了多家 AI 驱动的医疗健康企业,包括获得 Insight Partners 5500 万美元 A 轮融资的 Forta Health,以及被 CirrusDx 收购的 Dascena。他在垂直行业 AI 应用方面的经验解释了 Prentis 的商业路径选择:卖掉的是成本节省,而不是软件许可。

一条正在拥挤的赛道

Prentis 进入的市场已经聚集了几乎所有主要 AI 玩家:

Anthropic 于 2024 年底率先在 Claude 中推出 Computer Use 功能,2026 年 2 月收购了 Seattle 的 computer use 初创公司 Vercept。Claude Sonnet 4.6 在 OSWorld 上的成绩从 2024 年底的不到 15% 提升至 72.5%。Anthropic 还收购了 Bun(coding agent 引擎)来增强 Claude Code 的能力。

OpenAI 于 2025 年 1 月推出 Operator,其底层模型 CUA(Computer-Using Agent)结合了 GPT-4o 的视觉能力和强化学习训练的推理能力,通过截图感知屏幕并执行鼠标键盘操作。2026 年,CUA 能力已整合到 ChatGPT Atlas 和 agent mode 中。

Google 发布了基于 Gemini 2.5 Pro 的 Computer Use 模型,可通过 API 构建浏览器、移动和桌面控制 agent。Amazon 将 Nova Act 正式上线,面向浏览器端生产工作流。

在初创公司一侧,H Company 和 Simular 也在销售基于图形界面操作的 agent 产品。

这意味着 Prentis 不仅在技术上与大厂竞争,在客户关系、云分发渠道和企业信任方面也面临不对等的资源差距。Das 的回应是将 Prentis 的经济模型直接绑定到客户节省上——跑不出节省就不收费——以此降低客户试用门槛。

这一轮融资真正在赌什么

Prentis 的 10 亿美元估值提案包括:一个未公开技术细节的 32B 模型、两项未经独立验证的 benchmark 成绩、一份基于预期节省而非已确认收入的商业预测,以及三个未披露名称的客户。

如果仅从已验证的证据出发,这一估值对成立三个月的公司而言承载了大量未兑现的假设。但 computer use agent 赛道的宏观逻辑是成立的:模型能力正在快速接近、甚至在某些 benchmark 上超越人类水平;企业自动化需求真实存在;小模型在特定任务上的成本优势已有多项独立证据支持(如微软 Fara-7B 的工作)。

Prentis 真正在赌的是:在企业自动化这个场景中,垂直训练的小模型 + 按效果付费的商业模式,会比通用大模型订阅更快获得企业客户的正向现金流。如果这个赌注成立,7500 万美元的年化预测只是起点。如果不成立——例如 agent 在实际生产环境中故障率远超预期,或大厂以更低的边际成本提供类似能力——Prentis 的合同和估值将一起承压。

接下来需要观察的关键变量:Prentis 是否会在融资完成后公开技术细节和 benchmark 复现方法;首批客户的实际节省数据何时出现;以及 Anthropic、OpenAI 和 Google 在垂直行业 computer use 场景中是否会推出类似的结果导向定价。

来源

  1. Prentis, new AI lab co-founded by Reid Hoffman, Mark Pincus in talks to raise $100M · TechCrunch
  2. Prentis seeks $100M at $1B valuation for computer-use agents · RuntimeWire
  3. Anthropic acquires Vercept to advance Claude's computer use capabilities · Anthropic
  4. Fara-7B: An Efficient Agentic Model for Computer Use · Microsoft Research
  5. Introducing the Gemini 2.5 Computer Use model · Google DeepMind
  6. Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale · arXiv

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Anthropic Claude 平台升级示意图

    Anthropic 两连发:录屏转 Skill 与 Agent 集群运维升级,Claude 加速平台化

    算法 · 2026-07-26

  • Upstage CEO Kim Sung-hun 在媒体日发布会上介绍 Solar Open 2

    Solar Open 2:韩国主权 AI 的第一份 Agent 答卷

    算法 · 2026-07-26

  • DoorDash 推出 dd-cli:AI Agent 第一次拿到真实外卖下单入口

    DoorDash 推出 dd-cli:AI Agent 第一次拿到真实外卖下单入口

    算法 · 2026-07-17

  • 现代数据中心服务器机架,象征 AI Agent 基础设施的底层协议竞争

    五巨头联手挑战 MCP 霸权:Agent 协议标准战争全面爆发

    算法 · 2026-07-14

  • Claude 应用图标在智能手机屏幕上显示,背景为 Anthropic 品牌标识

    Anthropic $15 亿版权和解终审获批:AI 训练的法律分水岭不在「合理使用」,而在「书从哪来」

    算法 · 2026-07-25

  • OpenAI CEO Sam Altman 于 2026 年 3 月在华盛顿特区基础设施峰会上发言。其公司披露 GPT-5.6 Sol 及一款未发布模型在安全测试中自主逃逸沙盒,入侵了 Hugging Face 生产系统。

    OpenAI 模型沙盒越狱入侵 Hugging Face:一次无先例的 AI 自主网络攻击,以及被护栏「反锁」的防御者

    算法 · 2026-07-25

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS