Arena——那个几乎所有 AI 从业者都用来看模型排名的 Chatbot Arena——在推出商业服务仅 8 个月后,达到了 1 亿美元年化收入。这家从 UC Berkeley 学术项目孵化出的公司,2025 年 5 月以 6 亿美元估值完成 1 亿美元种子轮,2026 年 1 月再以 17 亿美元估值完成 1.5 亿美元 A 轮。目前累计融资 2.5 亿美元,投资人包括 a16z、Felicis、Kleiner Perkins 和 Lightspeed。
这个数字本身不算巨大——但问题不在这里。问题在于,AI 行业最信任的评测标准正在从学术公共品变成一门生意,而这个过程中积累起来的争议指向一个根本矛盾:当裁判自己下场赚钱,谁来保证计分板没被动手脚?
从学术副项目到估值 17 亿美元
Chatbot Arena 的出身是学术 open-source 文化的教科书范例。2023 年,UC Berkeley 博士生 Anastasios Angelopoulos 和 Wei-Lin Chiang 在 LMSYS 研究组织下做了一个简单工具:用户提交一个 prompt,两个匿名模型各给一个回答,用户选出更好的那个。数百万次投票被聚合成 Elo 排名。
这个机制天然抵抗了传统 benchmark 的污染问题。MMLU、HumanEval 这类静态测试集可以被模型"背题",但 Chatbot Arena 每天有约 75% 的 prompt 是全新的,投票者在不知道模型身份的情况下做出选择。截至 2025 年 9 月,平台已收集超过 350 万次投票,覆盖 400 多个模型,prompt 分布在 600 多个任务类型中,从 SQL 生成到旅行规划到法律推理,最大的单一类别仅占所有 prompt 的 1%。
2025 年 4 月,LMSYS 的研究者将 Chatbot Arena 从学术项目拆分为独立公司 Arena Intelligence Inc.。CEO Angelopoulos 是 UC Berkeley 博士后,专攻可信 AI 系统;CTO Chiang 研究分布式系统和深度学习框架;联合创始人兼顾问 Ion Stoica 是 Berkeley 教授、Databricks 联合创始人。一个月后种子轮 1 亿美元到账。四个月后首款商业产品 AI Evaluations 上线。再四个月年化收入 3000 万美元。又过了四个月——1 亿美元。
谁在付钱?
Arena 的商业模式是两层结构。底层是免费公开排行榜,任何人都能比较模型。上层是 AI Evaluations——为模型实验室和企业客户提供深度性能分析、私有排行榜、定制化评估和红队测试。
CEO Angelopoulos 对 TechCrunch 坦承:"很多人甚至不知道我们的业务在赚钱;人们仍然把我们当成一个开源项目。"他还澄清收入实际是"消费型"(consumption-based)而非传统意义上的"经常性收入",但客户复购率足够高。
Arena 将自己定位为与 Mercor、Surge 和 Scale AI 竞争"同一美元"——这些公司都在帮模型制造商做后训练优化。这里隐含了一个重要转变:Arena 不再只做计分员,它正在进入 AI 开发价值链的上游。
而这一转变恰好触及 Arena 最敏感的神经。
排行榜的幻象
2025 年 4 月 30 日,来自 Cohere、Stanford、MIT 和 Ai2 的研究者在 arXiv 上发表论文《The Leaderboard Illusion》,分析了 280 万次模型对战,指控平台给予少数大型 AI 公司不成比例的特权。
最刺眼的是私有测试。论文指称 Meta 在 Llama 4 发布前的三个月内私下测试了 27 个模型变体,Google 测试了 10 个。这些公司反复提交、择优发布、悄悄撤回低分模型。而小型公司和开源项目没有同样的特权。
数据分配严重倾斜。OpenAI 的模型出现在约 20.4% 的对战中,Google 占 19.2%,而 83 个开源模型合计仅获得 29.7%。论文合著者、Cohere AI 研究 VP Sara Hooker 对 TechCrunch 直言:"只有少数公司被告知私有测试可用,有些公司获得的私有测试量远超其他公司。这就是操纵。"
引爆公众关注的还有 Llama 4 事件。Meta 专门优化了一个"对话性"版本在 Chatbot Arena 中拿高分,但最终公开发布的却是另一个版本——排行榜上的表现远不如"特供版"。开发者 Simon Willison 写道:"如果商业供应商可以提交几十个模型,然后精心挑选得分最高的那个公开发布,Arena 正在非常积极地鼓励模型厂商去操纵系统。"
Arena 拒绝了大部分指控。联合创始人 Stoica 称论文存在"不准确"和"有问题的分析"。Arena 表示预发布测试政策自 2024 年 3 月起已公开,要求公布未发布模型的分数"没有意义"。不过它承认将改进采样算法使对战出现频率更均衡。
当裁判变成生意
Arena 的核心矛盾在于:它的公信力来自"中立裁判"的定位,但它的商业模式依赖向参赛选手收费。
私有排行榜允许企业客户使用敏感数据在封闭环境中评估模型,完全不受社区监督。数据访问层面,Arena 承诺公开发布 20% 的偏好数据,但保留 80% 作为商业产品的战略资产——排他性分配本身就是定价权的一部分。
更大的图景是,AI 行业的评测基础设施正在经历一次产业重组。传统学术 benchmark 被模型背烂之后,Chatbot Arena 的人机盲测法一度被视为救命稻草。它提供真实用户、真实场景、动态更新的评测信号——相比于静态的 MMLU 分数,这看起来更接近"真正的好用"。
但当这个评测系统本身不再独立——当一家估值 17 亿美元的公司掌握"哪种 AI 最好"的最终话语权——整个行业的决策开始围绕一个可能被操纵的信号旋转。这就是 Goodhart 定律的终极演绎:当一个指标变成目标,它就不再是好的指标。
Andrej Karpathy 在争议爆发后提议关注 OpenRouter 的排名作为替代——后者基于真实 API 使用数据,反映的是开发者在成本与能力之间的实际选择。这不是完美的解决方案,但它指向了评测的未来方向:不是找一个更"准"的排行榜,而是构建更难被操纵的评价体系。
Arena 在 AI 基础设施栈中占据了一个极其独特的位置——不造模型,但定义谁赢。这个位置的商业价值随着 AI 市场规模膨胀而增长。但它的生存取决于一个悖论:它需要同时是参赛者愿意付费的裁判,和观众相信公正的裁判。