AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

FormInv:数学推理基准的语义不变性审计——\"No-Free-Benchmark\"定理

2026年5月30日 · 2026-05-30

arXiv

榜单与结果

FormInv:数学推理基准的语义不变性审计——"No-Free-Benchmark"定理

FormInv 对 MathCheck(ICLR 2025)的改写质量审计发现 129 组中有 4 组(3.1%)语义错误;移除这些错误后 GPT-4o 从第 2 跌至第 4,Claude Haiku 和 DeepSeek V3 反超——该排名变化在任何单模型评估中不可见。更深层的问题是:Claude Haiku 4.5 准确率达 86% 但语义一致性率(SCR)仅 50%,即半数定理在语义等价改写下给出不同答案;9 个模型准确率跨度仅 86%–96%,SCR 却跨 50%–82%——32 个百分点的测量鸿沟。形式化结论:对 9 个前沿模型的任意目标排名,存在改写族的权重分配使之成立(No-Free-Benchmark 推论)——因为无一模型在所有改写族上帕累托占优,基准设计者选择改写族即隐式决定了谁胜出。

来源:arXiv《FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks》(2026-05-29)https://arxiv.org/abs/2605.29001

FinVerBench:财务报表验证——14 个 LLM 中 9 个在干净报表上产生 95%–100% 误报

FinVerBench 基于 43 家标普 500 公司 SEC 10-K XBRL 申报构建,定义四类错误分类体系(算术、跨表勾稽、同比、量级扰动)。在 105 实例可观测诊断子集(43 干净 / 62 含错)上,使用原始引导清单提示时,14 次完整运行中 9 次在干净报表上产生 95%–100% 误报,仅 1 次达到 0% 观察误报率。渲染方式显著影响召回:在现实舍入变体上校准后模型召回率 79.0% 且 0% 误报率,而非舍入诊断变体上为 100.0%。结论:财务报表验证不是单纯的算术检测,而是在不完整可观测性、提示诱导假设和现实数值渲染下的校准判断。

来源:arXiv《FinVerBench: Benchmark Validity and Calibration in Large Language Model Financial Statement Verification》(2026-05-29)https://arxiv.org/abs/2605.29586

MINDGAMES:多 Agent 社交与策略推理竞技场——76 队 944 Agent、29,571 局博弈

MINDGAMES 在 TextArena 上提供统一交互接口、TrueSkill 评分和全轨迹日志,覆盖四款游戏(Colonel Blotto、Iterated Prisoner's Dilemma、Codenames、Secret Mafia),分别操作化信念归因、对手建模、合作推理和持续欺骗四种"心理理论"相关能力。2025 年某顶级 AI 会议竞赛周期评估了 76 队 944 个提交 Agent。分析揭示:规则遵守脆弱性是主要瓶颈,顶级系统反复依赖显式结构化脚手架,排行榜有效性在不同环境间差异显著——高失败率环境可能奖励对对手错误的鲁棒性与战略能力同样多,Secret Mafia 在本周期内呈现明显的"错误生存"混淆。同步发布 MG-Ref 确定性离线锦标赛协议及 29,571 局数据。

来源:arXiv《MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs》(2026-05-29)https://arxiv.org/abs/2605.29512

EVA-Bench:语音 Agent 端到端评测——无一系统同时在准确性与体验上超过 0.5

EVA-Bench 覆盖三个企业领域 213 个场景,引入两个复合指标:EVA-A(准确性:任务完成、忠实度、音频级语音保真度)和 EVA-X(体验:对话推进、口语简洁性、轮流时序)。12 个系统跨三种架构的评测显示:(1) 无一系统在 EVA-A pass@1 和 EVA-X pass@1 上同时超过 0.5;(2) 峰值与可靠性能大幅分化(EVA-A 的 pass@k 与 pass^k 中位差距 0.44);(3) 口音和噪声扰动暴露显著鲁棒性缺口(平均 Δ 最高 0.314)。框架开源。

来源:arXiv《EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents》(v2: 2026-05-29)https://arxiv.org/abs/2605.13841

Cookie-Bench:前端 Web 生成的无参考自主评测——13 个前沿 LLM 仍有大量进步空间

Cookie-Bench 含 11 领域、54 叶节点、1,000 查询,覆盖静态展示和交互应用任务,三等难度、三语种均衡。评测框架基于 Flavell 元认知监控理论,分三阶段:静态感知、Agent 驱动交互(连续屏幕录制)、动态评分(功能和美学整体判断加结构化失败归因)。与专家人工评分高度一致,同时揭示 13 个前沿 LLM 在交互式 Web 生成上仍有显著不足。

来源:arXiv《Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation》(2026-05-29)https://arxiv.org/abs/2605.30000

方法与争议

Review Arcade:LLM 审稿可被"套路"——迭代改写使最高 35% 论文评分显著提升

在 2025 ACL Rolling Review 论文上的实验表明:LLM 审稿与人类审稿对齐有限,且在不同提示和模型间差异显著。更关键的是,作者使用迭代草稿-修订工作流按 LLM 审稿意见修改后,在特定场景下可使最高 35% 论文的整体评分获得统计显著提升。LLM 审稿已被主流会议正式试点,该发现对审稿完整性构成直接挑战。

来源:arXiv《Review Arcade: On the Human Alignment and Gameability of LLM Reviews》(2026-05-29)https://arxiv.org/abs/2605.28897 | 代码:https://github.com/uhh-hcds/reviewarcade

LaRA:RL 后训练阶段的数据污染检测——层级表征分析框架

现有污染检测方法依赖输出级信号(似然、熵),但对 RL 后训练模型不可靠——RL 通过轨迹级奖励而非 token 似然塑造行为。LaRA 引入三个互补指标(扰动敏感性、方向坍缩、局部表征刚性),发现污染在层级间产生渐进几何偏差。基于此构建的检测协议在 RL 训练推理模型上优于现有输出级基线。该工作填补了 RL 后训练污染检测的空白。

来源:arXiv《LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training》(2026-05-29)https://arxiv.org/abs/2605.29888

PRAIB:11,000 篇 LLM 审稿行为审计——评分变异性低、正向偏差、过度自信

PRAIB 对比 5 个模型为 1,000 篇 ICLR/NeurIPS 论文生成的 11,000 篇审稿与原始人类反馈,发现系统性行为分歧:LLM 评分变异性更低、呈正向偏差且过度自信,交叉引用模式依赖模型且不同于人类规范;LLM 审稿更长更复杂,却频繁遗漏人类审稿人指出的原子级弱点。PRAIB 为社区提供诊断工具,用于识别 LLM 可可靠支持审稿的哪些方面。

来源:arXiv《PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing》(2026-05-29)https://arxiv.org/abs/2605.29815

后理解时代的基准测评:Critique-Resilient Benchmarking——将测评重新定义为对抗博弈

随着前沿 LLM 在新基准发布后迅速饱和,人类将越来越难以生成有区分力的任务、提供准确真值答案或评估复杂解答——作者称之为"后理解体制"。提出的 Critique-Resilient Benchmarking 依赖"抗批评正确性":若无对手能令人信服地证明答案错误,即视为正确。人类仅作为有界验证者聚焦局部主张,在数学领域对 8 个前沿 LLM 的实验显示评分稳定且与外部能力度量相关。

来源:arXiv《Benchmarking at the Edge of Comprehension》(v3: 2026-05-29)https://arxiv.org/abs/2602.14307

KBF:知识边界指纹——6 平台影子审计发现 7/27 模型单元与参考端点不一致

KBF 利用知识边界附近的稳定数值召回率为模型 API 生成指纹。在 16 个生产 LLM 端点上,KBF 标记所有 155 个经济相关替换而不误拒任何同模型对照;可检测仅 5%–10% 流量被替换的高分离混合路由攻击。对 6 个平台的影子 API 审计发现 27 个模型单元中有 7 个与参考端点统计不一致,不一致集中在 premium Claude 端点。

来源:arXiv《KBF: Knowledge Boundary as Fingerprint for Language Model and Black-Box API Auditing》(2026-05-29)https://arxiv.org/abs/2605.29524

Token Inflation:审计信任悖论——隐藏推理用量可被虚增 1,469% 而不被检测

按 token 计费已成 LLM 商业标准,但计费审计存在先天信任悖论:审计方只能检查提供商自己提供的证据。三种最新 token 审计框架均无法阻止拥有普通商业能力的提供商系统性虚增计费 token 数。最宽松设定下隐藏推理用量可平均虚增 1,469%——一张 $100 的诚实账单变成约 $1,569。即使可查看完整推理串,token 化歧义仍允许 50.85% 的过度报告低于检测阈值。

来源:arXiv《Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage》(2026-05-29)https://arxiv.org/abs/2605.30040

GEO-Bench:首个生成引擎优化排名操纵统一基准——黑盒内容改写匹配甚至超越梯度攻击

GEO-Bench 统一评估黑盒提示攻击(TAP、Zero-Shot)、白盒梯度攻击(STS、RAF、StealthRank)和十种白帽 C-SEO 策略,在 5 个数据集上以固定开放权重排序器(Llama-3.1-8B-Instruct)评分。结果显示效果与隐蔽性存在权衡,黑盒内容改写在某些领域排名提升匹配或超越梯度攻击,且可同时规避关键词和困惑度检测。

来源:arXiv《GEO-Bench: Benchmarking Ranking Manipulation in Generative Engine Optimization》(2026-05-29)https://arxiv.org/abs/2605.29107

工具与标准

Croissant Tasks:可复现 ML 评估的声明式元数据格式

Croissant Tasks 将任务问题与解决方案形式化解耦,实现"概念可复现性"——通过独立、Agent 生成的实现验证主张,而非脆弱的源码复制。贡献包括:(1) Croissant Tasks 规范;(2) 将现有基准自动逆向适配为该格式的 LLM 管线;(3) 自主 Agent 可从规范生成功能正确复现管线的实证验证。作者包括 Isabelle Guyon、Joaquin Vanschoren 等。

来源:arXiv《Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations》(2026-05-29)https://arxiv.org/abs/2605.29786

CalArena:迄今最大规模后验校准基准——近 2,000 次实验、数十种方法

CalArena 覆盖表格和计算机视觉任务的二分类、多分类和大规模分类设置,汇总经典模型、现代深度学习架构和基础模型的预测,在统一框架内提供数十种校准方法的可复现实现。提出 Post-Hoc Improvement(PHI)作为比较后验方法的更有原则的替代方案。跨领域一致模式:平滑校准函数优于分箱方法,高维设置中专用的多分类方法必不可少,无校准特定设计的通用 ML 模型不具竞争力。

来源:arXiv《CalArena: A Large-Scale Post-Hoc Calibration Benchmark》(2026-05-29)https://arxiv.org/abs/2605.30188

LogDx-CI:CI 失败日志缩减工具的基准评测——混合 grep+tail 路由器主导成本-质量前沿

比较 11 种上下文缩减工具在 35 个真实 GitHub Actions 失败案例上的表现,由 3 个 LLM 调试器家族评分。核心发现:(1) 混合 grep+tail 路由器以约 $0.03/案例达到 0.670/0.666 分,质量与独立 grep 相当但 token 用量减少 4.5 倍;(2) Agent 循环体制下质量范围坍缩 7 倍(单次跨度 0.42 → Agent 循环跨度 0.059),但弱上下文迫使 Agent 发出 2–4 倍工具调用;(3) 跨家族 LLM 摘要对(gpt-5-mini 摘要器 + Claude Haiku 调试器)比同家族对平均高出 +0.071,证伪了自我调用偏差假说。

来源:arXiv《LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis》(2026-05-29)https://arxiv.org/abs/2605.28876

e-valuator:将任意黑盒验证器分数转化为有统计保证的决策规则

e-valuator 将轨迹成功/失败判别框架为序贯假设检验问题,基于 e-processes 构建在 Agent 轨迹每一步均保持统计有效性的序贯检验,支持对任意长度动作序列的在线监控。6 个数据集、3 个 Agent 上的实验显示其统计功效和误报率控制均优于其他策略,且可用于提前终止问题轨迹以节省 token。

来源:arXiv《E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing》(v2: 2026-05-29)https://arxiv.org/abs/2512.03109


说明:本期窗口以 5 月 29 日 arXiv 集中上线为主力,侧重:(1) 基准排名可信度的计量危机——FormInv "No-Free-Benchmark" 正式证明改写族选择即隐式决定排名,MathCheck 仅 4 个错误改写就翻转前三;(2) LLM 审稿生态的实证审计——Review Arcade 发现迭代改写可使 35% 论文评分提升,PRAIB 在 11,000 篇审稿中揭示系统性正向偏差与关键弱点遗漏;(3) API 经济与审计基础设施——KBF 指纹协议发现 7/27 平台模型不一致,Token Inflation 揭示 1,469% 计费虚增风险;(4) 新基准——FinVerBench(财务报表验证,9/14 模型 95%–100% 误报)、MINDGAMES(29,571 局多 Agent 博弈)、EVA-Bench(语音 Agent)、Cookie-Bench(WebDev);(5) 评测基础设施建设——Croissant Tasks(可复现性元数据)、CalArena(后验校准)、LogDx-CI(日志缩减)、e-valuator(统计保证验证)。上期已覆盖的 TASTE、RAMP、Harness-Bench、统一 Agentic 框架、KTD-Fin、VibeSearchBench、GSM-Symbolic 统计重评、评测元知识、Reward Bias Substitution、CoT 蒸馏悖论、Debate、COVCAL、抑郁检测审计、多阶段 Pipeline 分解、AGI 认知框架、BenchAlign、低资源基准、ABA、AI Cartography 等不再重复。

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • XCENA 面向 AI 系统设计的内存芯片与电路板XCENA 融资 1.35 亿美元,押注 AI 的下一瓶颈是内存Daily · 5月29日
  • 一名人物侧身拿着手机与 Sesame 语音助手对话Sesame 推出 iOS 应用,实时语音 Agent 进入移动端Daily · 5月28日
  • Robinhood Agentic Trading 产品界面展示账户与交易操作Robinhood 让 AI Agent 交易股票,权限设计开始直接影响余额Daily · 5月27日
  • 多个人工智能助手站在分割的平台上的概念插画严格窗口内未发现足以成条的 AI 产业新增Daily · 5月26日
  • 教宗 Leo XIV 在公开活动中讲话教宗 AI 通谕把问题转向劳动、文化与收益分配Daily · 5月25日
  • Amazon Bee 可穿戴助手的手机端应用界面Amazon Bee 把持续记录带进可穿戴设备Daily · 5月24日
  • 一辆 Ferrari F1 赛车在赛道上高速行驶Ferrari 用 IBM AI 经营 F1 粉丝关系Daily · 5月23日
  • Google AI 眼镜的多款产品合成展示图Google AI 眼镜接近可用,硬件边界仍比模型演示更关键Daily · 5月22日
  • 空旷办公室里一名人物站在落地窗前的剪影Hark 获 7 亿美元 A 轮,通用 AI 界面继续吸走巨额资本Daily · 5月21日
  • 手机屏幕上的 Intuit 标志与背景中的股票行情图Intuit 裁员逾 3000 人,把资源重新押向 AIDaily · 5月20日
  • Andrej Karpathy 在技术活动上发言Karpathy 加入 Anthropic,前沿实验室继续争夺预训练人才Daily · 5月19日
  • 一只手拿着显示 Kin Health 应用界面的手机Kin Health 获 900 万美元,把 AI 就诊记录交到患者手中Daily · 5月18日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS