一个 AI Agent 被扔进一家真实公司的运营系统里——数百张数据库表、几十万份文件、数百万条 Slack 消息和 Jira 工单。它的任务是完成这家公司员工曾经做过的实际工作:从分析师每天的查询到高管层的跨月战略项目。64 个任务,每个跑 10 遍。
最强模型 GPT-5.5 的完成率是 44.4%。Claude Opus 4.8 是 35.9%。Gemini 3.1 Pro 掉到了 18.3%。
这是 Turing 于 8 月 5 日发布的 CompanyBench。它可能是 2026 年迄今为止对 AI Agent 在企业场景中真实表现最有说服力的一次测试——不是因为分数有多低,而是因为它终于用一个问题替换了行业里一直问的那个问题:不是"模型有多聪明",而是"模型能不能把活干完"。
不是又一个合成 benchmark
过去两年,Agent benchmark 经历了一场信任危机。2026 年 4 月,UC Berkeley 的研究者证明 8 个主流 Agent benchmark——包括 SWE-bench、WebArena、OSWorld、GAIA——全都可以通过 reward-hacking 打到接近 100% 的分数,不需要真正解决任何一个任务。SWE-bench Verified 的顶尖模型已经冲到 93.9%,但 SWE-bench Pro(更接近真实工程场景的版本)直接腰斩,顶尖模型仅 69.2%。OpenAI 在 2026 年 2 月的审计中发现,SWE-bench Verified 中 59.4% 的最难任务即使 bug 没修复也能通过测试。
市场隐约知道现有 benchmark 在测量一种被精心修剪过的智能。CompanyBench 的不同之处在于它没有"设计任务"——它从一家公司的历史记录里挖出了真实发生过的工作,把任务所需的全部上下文原样保留:数据仓库、政策文档、Slack 沟通记录、Jira 工单和客服系统。
这家公司是一家金融科技企业。Turing 获取了其五年运营周期内的所有数据,PII 全部清洗:1.48 亿行的生产数据库、数万份文件、数以百万计的 Slack 消息和 Jira tickets。模型的输出也不是选择题或单元测试——它必须真的把分析结果发到 Slack 频道,或在 Jira 里建一张工单。
44% 意味着什么
64 个任务各跑 10 次,总计 640 次测试。GPT-5.5 在 44.4% 的测试中完成了所有要求动作。Claude Opus 4.8 为 35.9%。这个差距本身不奇怪——GPT-5.5 在多个 Agent benchmark 上略领先于 Opus 4.8。真正值得注意的是 Gemini 3.1 Pro 的 18.3%,以及 Gemini 3.5 Flash 几乎从未完成需要写入 Slack 或 Jira 的任务。
但这些数字本身没有那四类失败模式有信息量。Turing 团队在所有模型运行中都观察到了相同的失败类型:
不读文档。 模型不去 Slack 或 Confluence 里搜索和阅读正确的文档,而是直接猜测该查哪些表、哪些列、用什么分析逻辑。在一个真实企业里,"猜"通常意味着全错。
追逐不存在的文档。 当一个值无法立刻找到时,模型会过度消耗搜索预算,去寻找一份压根不存在的权威文档,最终带着空结果或猜测答案终止。
擅自加过滤条件。 模型会"改进"一个刻意简单的 SQL 查询,加上一些看起来合理的额外过滤——转账形态约束、时间窗口锚点、状态码——这些过滤条件静默地剔除了合法数据行。SQL 跑通了,答案也出来了,但是错的。
最后一步丢失。 模型反复把算出的数字当作终点,跳过必须执行的 Slack 发布或 Jira 建单操作,即便在分析完全正确的运行中也是如此。
这四类失败有一个共同特征:它们与技术能力无关。模型可以正确地进行多步推理、撰写 SQL、解析文档结构。它失败的地方在读指令、确认事实、完成交付——一种类似于人类"不仔细"和"想当然"的行为模式。
与现有评测体系的关键差异
CompanyBench 的出险对现有的 benchmark 分类法构成了一个值得注意的补充。TAU²-bench(Sierra Research,2024 年发布,2026 年大幅扩展)是当前最接近企业场景的评测之一——它模拟客服场景,要求 agent 既完成任务又遵守书面政策,并把每项任务重复运行 k 次以排除偶然成功。CompanyBench 在同一个方向上走得更远:它把"模拟环境"替换成了真实的历史数据,把"政策"替换成了散落在 Slack、Confluence 和工单系统里的日常沟通。
与 SWE-bench 系列集中于代码修改不同,与 OSWorld 集中于桌面 GUI 操作不同,CompanyBench 测试的是一类几乎未被覆盖的能力:在信息散落、文档不全、需要判断"到底应该做什么"而不是"应该怎么做的"真实企业环境里,把端到端的工作流程跑通。
这一区分对企业 AI 部署有直接含义。一家公司不会只关心 agent 能不能写对 SQL,它会关心 agent 能不能在没人告诉它数据库结构的情况下找到正确的数据源,能不能区分一份 Slack 讨论和一份正式政策文档,能不能在没有明确的"正确输出"提示时判断任务是否真的做完了。
Turing 的战略意图
CompanyBench 不是一个中立的学术项目。Turing 的商业模式建立在为前沿 AI 实验室提供高质量数据、评估和训练基础设施之上。CEO Jonathan Siddharth 最近在一篇博客中写道:"数据公司看不到部署,部署公司看不到数据。Turing 两者都看。"
这家 2018 年成立的公司已经悄然成为 AI 基础设施领域的重要角色,其客户涵盖 OpenAI、Anthropic、Meta、Google、Microsoft、Nvidia 和 Amazon 等主要 AI 实验室。Turing 在公开声明中将自己定位为"世界领先的 AGI 研究加速器"。
CompanyBench 的战略逻辑很清晰:Turing 正在同时建造标杆和解决方案。一个暴露企业在 agent 部署中真实痛点的 benchmark,也是向那些正在挣扎的企业客户展示"你需要更好的数据和评估基础设施"的最佳论证。这并不减损 benchmark 本身的信息价值,但读者在引用其结果时需要理解其商业语境。
约束与待回答问题
CompanyBench 当前的局限性同样值得注意。首先,它只覆盖了一家金融科技公司。金融科技的工作流——查询数据库、生成报告、跨系统协调——在知识工作领域有代表性,但不能代表制造业、医疗、法律或其他垂直领域的企业场景。其次,Turing 未披露这家公司的身份,这使得独立研究者无法验证数据分布、任务难度校准或潜在的领域偏置。第三,每个任务跑 10 次的设定虽然比单次评估可靠,但 10 次仍然是一个较小样本,置信区间可能较宽。
对于正在评估 AI Agent 的企业决策者而言,CompanyBench 传递的核心信号不是"模型不行",而是"你正在使用的 benchmark 很可能测量了错误的东西"。一个在 SWE-bench 上拿到 90% 的 agent,可能在你的真实环境里只有不到一半的任务完成率——不是因为它在真实环境里变笨了,而是因为真实环境需要的很多能力和 SWE-bench 测量的不是同一组能力。
CompanyBench 的 dashboard 已经在 companybench.turing.com 上线,Turing 表示将持续评估新模型。它的长期价值将取决于能否扩展到更多行业、更多公司、更多类型的任务——以及独立研究者能否获得足够透明的数据来验证其主张。

