FormInv:数学推理基准的语义不变性审计——"No-Free-Benchmark"定理
FormInv 对 MathCheck(ICLR 2025)的改写质量审计发现 129 组中有 4 组(3.1%)语义错误;移除这些错误后 GPT-4o 从第 2 跌至第 4,Claude Haiku 和 DeepSeek V3 反超——该排名变化在任何单模型评估中不可见。更深层的问题是:Claude Haiku 4.5 准确率达 86% 但语义一致性率(SCR)仅 50%,即半数定理在语义等价改写下给出不同答案;9 个模型准确率跨度仅 86%–96%,SCR 却跨 50%–82%——32 个百分点的测量鸿沟。形式化结论:对 9 个前沿模型的任意目标排名,存在改写族的权重分配使之成立(No-Free-Benchmark 推论)——因为无一模型在所有改写族上帕累托占优,基准设计者选择改写族即隐式决定了谁胜出。
来源:arXiv《FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks》(2026-05-29)https://arxiv.org/abs/2605.29001
FinVerBench:财务报表验证——14 个 LLM 中 9 个在干净报表上产生 95%–100% 误报
FinVerBench 基于 43 家标普 500 公司 SEC 10-K XBRL 申报构建,定义四类错误分类体系(算术、跨表勾稽、同比、量级扰动)。在 105 实例可观测诊断子集(43 干净 / 62 含错)上,使用原始引导清单提示时,14 次完整运行中 9 次在干净报表上产生 95%–100% 误报,仅 1 次达到 0% 观察误报率。渲染方式显著影响召回:在现实舍入变体上校准后模型召回率 79.0% 且 0% 误报率,而非舍入诊断变体上为 100.0%。结论:财务报表验证不是单纯的算术检测,而是在不完整可观测性、提示诱导假设和现实数值渲染下的校准判断。
来源:arXiv《FinVerBench: Benchmark Validity and Calibration in Large Language Model Financial Statement Verification》(2026-05-29)https://arxiv.org/abs/2605.29586
MINDGAMES:多 Agent 社交与策略推理竞技场——76 队 944 Agent、29,571 局博弈
MINDGAMES 在 TextArena 上提供统一交互接口、TrueSkill 评分和全轨迹日志,覆盖四款游戏(Colonel Blotto、Iterated Prisoner's Dilemma、Codenames、Secret Mafia),分别操作化信念归因、对手建模、合作推理和持续欺骗四种"心理理论"相关能力。2025 年某顶级 AI 会议竞赛周期评估了 76 队 944 个提交 Agent。分析揭示:规则遵守脆弱性是主要瓶颈,顶级系统反复依赖显式结构化脚手架,排行榜有效性在不同环境间差异显著——高失败率环境可能奖励对对手错误的鲁棒性与战略能力同样多,Secret Mafia 在本周期内呈现明显的"错误生存"混淆。同步发布 MG-Ref 确定性离线锦标赛协议及 29,571 局数据。
来源:arXiv《MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs》(2026-05-29)https://arxiv.org/abs/2605.29512
EVA-Bench:语音 Agent 端到端评测——无一系统同时在准确性与体验上超过 0.5
EVA-Bench 覆盖三个企业领域 213 个场景,引入两个复合指标:EVA-A(准确性:任务完成、忠实度、音频级语音保真度)和 EVA-X(体验:对话推进、口语简洁性、轮流时序)。12 个系统跨三种架构的评测显示:(1) 无一系统在 EVA-A pass@1 和 EVA-X pass@1 上同时超过 0.5;(2) 峰值与可靠性能大幅分化(EVA-A 的 pass@k 与 pass^k 中位差距 0.44);(3) 口音和噪声扰动暴露显著鲁棒性缺口(平均 Δ 最高 0.314)。框架开源。
来源:arXiv《EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents》(v2: 2026-05-29)https://arxiv.org/abs/2605.13841
Cookie-Bench:前端 Web 生成的无参考自主评测——13 个前沿 LLM 仍有大量进步空间
Cookie-Bench 含 11 领域、54 叶节点、1,000 查询,覆盖静态展示和交互应用任务,三等难度、三语种均衡。评测框架基于 Flavell 元认知监控理论,分三阶段:静态感知、Agent 驱动交互(连续屏幕录制)、动态评分(功能和美学整体判断加结构化失败归因)。与专家人工评分高度一致,同时揭示 13 个前沿 LLM 在交互式 Web 生成上仍有显著不足。
来源:arXiv《Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation》(2026-05-29)https://arxiv.org/abs/2605.30000