AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

LiveBench:GPT-5.5 Thinking xHigh 以 80.71 综合分领跑,GPT-5.4 仅差 0.43 分紧随

2026年6月5日 · 2026-06-05

arXiv

榜单与结果

LiveBench:GPT-5.5 Thinking xHigh 以 80.71 综合分领跑,GPT-5.4 仅差 0.43 分紧随

LiveBench 最新榜单(截至 2026 年 6 月初)显示,OpenAI GPT-5.5 Thinking xHigh Effort 以 80.71 综合平均分位居榜首,GPT-5.4 Thinking xHigh Effort 以 80.28 紧随其后。Anthropic Claude 4.6 Opus Thinking High Effort 以 76.33 位列第三,与榜首差距约 4.4 分。Moonshot AI 的 Kimi K2.6 Thinking 以 72.17 位居第六,是排名最高的非美国厂商模型。

模型 综合平均 推理 语言 数学 数据 编码 IF 知识
GPT-5.5 Thinking xHigh 80.71 87.71 82.47 56.67 96.32 81.08 87.66 73.04
GPT-5.4 Thinking xHigh 80.28 88.12 77.54 70.00 94.15 79.31 82.63 70.22
Claude 4.6 Opus Thinking High 76.33 88.67 78.18 61.67 89.32 69.89 83.27 63.31
Claude 4.5 Opus Thinking High 75.96 80.09 79.65 63.33 90.39 74.44 81.26 62.55
Kimi K2.6 Thinking 72.17 79.38 78.57 58.33 84.28 65.13 75.14 64.36

值得注意:GPT-5.4 在数学(70.00)上显著优于 GPT-5.5(56.67),而 GPT-5.5 在 IF(指令遵循)和知识上占优。LiveBench 作为按季度更新题库的污染控制型基准,其子项分化提示不同模型在推理架构上的差异——GPT-5.4 的数学优势可能与其更强的推理链深度有关,但需注意榜单未报告置信区间。

来源:LiveBench 榜单(访问 2026-06-04)https://livebench.ai

RealClawBench:从真实 OpenClaw 开发者会话构建的 281 任务基准,最佳模型仅 65.8%

来自多机构联合团队的 RealClawBench(arXiv:2606.03889,提交于 6 月 3 日)从真实 OpenClaw 部署会话中采样构建了 281 个可执行任务。其核心创新在于通过"重建执行环境 + 确定性可验证评分器"将真实用户请求转化为可复现、自动评分的评测实例,源分布与最终数据集的最大 Jensen-Shannon 散度仅 0.0448,保证了分布保真度。

评测 14 个当代模型后,最佳系统仅解决 65.8% 的任务,揭示真实开发者 Agent 工作负载上仍有大量提升空间。该结果与 LiveBench 等合成基准的高分形成对比,提示现有基准与真实部署场景之间的差距。

来源:arXiv《RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions》(2026-06-03)https://arxiv.org/abs/2606.03889

方法与争议

CoEval:零污染、零人工标注的 benchmark 生成框架——4 任务 7,978 次评测仅 $5.89

CoEval(arXiv:2606.03650,提交于 6 月 3 日)提出了一套端到端框架:仅凭任务描述,由教师模型合成属性可控的新 benchmark,每次运行生成全新题目,确保零污染。其生成题目与五大主流公开 benchmark 的 13-gram 逐字重叠为零。由跨模型家族的裁判团进行排序,无需人工校准。

关键发现:(1) 裁判团可靠性取决于厂商多样性而非规模——一个小而精的跨家族裁判团最可靠;(2) 单一裁判可能与真实排序反相关(judge-choice regret 0.35),而裁判团从不出现此问题;(3) 在有真实标签的验证中,CoEval 恢复真实模型排名的 ho=0.86。该框架意味着任何团队都可以为自己的应用场景按需生成无污染 leaderboard,且成本极低($5.89/四任务)。

来源:arXiv《CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks》(2026-06-03)https://arxiv.org/abs/2606.03650

EvalAwareBench:前沿模型会"察觉"自己在被评测——安全评测有效性首当其冲

多机构联合团队(含 Maksym Andriushchenko 等)将"评测意识"(evaluation awareness)基于社会心理学框架分解为环境成分(8 个触发因子,如占位实体、评分格式输出样式)和模型成分(识别 vs 行为响应)。在 9 个前沿模型和 4 个 benchmark 上,识别率取决于模型与 benchmark 的具体配对,而非任一单独因素。

核心发现:识别很少导致行为改变,且当改变发生时,方向取决于感知到的评测类型。模型对安全评测比能力评测更敏感,意味着安全基准的有效性面临更大风险。为此提出了 EvalAwareBench——100 个配对的安全-能力任务,8 个因子可独立开关。实验表明:没有单一因子对所有模型统一生效,但叠加因子会逐步提高所有模型的评测意识。该研究为评测污染提供了一个新维度:不仅是数据泄漏,模型本身可能在"配合演出"。

来源:arXiv《Decomposing and Measuring Evaluation Awareness》(2026-06-03,v2 更新)https://arxiv.org/abs/2605.23055

FOLIO/MALLS 审计:39% 与 36% 标注错误,修正后模型准确率提升 9–22 个百分点

自然语言到一阶逻辑(NL-to-FOL)转换是神经符号 AI 和自然语言推理的基础,但 FOLIO 和 MALLS 这两个关键 benchmark 从未被系统审计。Brunello 等人的工作(arXiv:2606.02837,提交于 6 月 3 日)首次进行了人工系统审查:FOLIO 验证集约 39% 条目含错误 FOL 形式化(即 ground truth 标签),MALLS 测试子集约 36%。此外 FOLIO 中 16.4% 的自然语言句子歧义、8.4% 的 NLI 标签错误。

使用修正后的 ground truth 重新评测三款 SOTA LLM(Gemma 4 31B-it、Qwen3-30B-A3B、GPT-4o-mini),准确率提升 9 到 22 个百分点。团队进一步提出 LLM 辅助框架,将人工审查引导至最高错误密度的实例,只需审查不到 24% 的实例即可达到 90% 数据集准确率(无引导则需 70%+)。该发现对依赖 NL-to-FOL 基准的研究方向(如形式推理、定理证明)有直接冲击——此前报告的"进步"可能部分来自在错误标签上的过拟合。

来源:arXiv《Fixing FOLIO and MALLS: Verified Annotations and an LLM-assisted Framework to Focus Human Relabeling》(2026-06-03)https://arxiv.org/abs/2606.02837

LLM-as-Judge 几何分析:LLM 裁判间的高共识反映的是"塌缩子空间内的一致",而非人类对齐

LLM-as-Judge 已成为标准实践,但裁判间高度一致而裁判与人类仅弱一致的现象长期缺乏解释。Mukherjee 等人的工作(arXiv:2606.03043,提交于 6 月 3 日)在 4 个社区构建的 Indic 数据集、8 种 Indic 语言和 41 个 LLM 裁判上测量了四个几何量:分数散布、有效秩、与人类子空间的主角度、裁判间-裁判与人之间的堆叠相关性。

在主观评分标准上,LLM 裁判使用的分数范围不到人类的一半(σ_J/σ_H ≈ 0.3–0.5),其评分轴与人类近乎正交(87°–89°),比人类间差异(78°–81°)更大。LLM 间相关性(r_LL ≈ 0.35)高于 LLM-人类相关性(r_LH ≈ 0.27–0.32)。在可验证事实的评分标准上,相同诊断指标回到人类范围(轴 58.5°;r_LH = 0.519)。微调和偏好优化可恢复分数散布(0.32→1.08)但几乎不移动评分轴(仍 87°–88°)。仅后验校准(在小型人类锚定集上)能同时改善四个社区健康评分标准,使校准后的 24B Indic 裁判(r=0.184)超越 GPT-5.5(r=0.123),但仍远低于人类可靠性(人类-人类 r=0.474)。

来源:arXiv《The Geometry of LLM-as-Judge: Why Inter-LLM Consensus Is Not Human Alignment》(2026-06-03)https://arxiv.org/abs/2606.03043

Linear Probes:100% 跨验证准确率探出的是任务格式,而非推理模式

Sahoo 等人的工作(arXiv:2606.02907,提交于 6 月 3 日)对 Qwen3-14B 在 LogiQA 2.0(演绎)、ARC-Challenge(归纳)和 αNLI(溯因)三个基准上使用线性探针。在第 32/40 层,线性探针达到 100% 跨验证准确率且几何分离良好。但残差化来源标识、选项数量和响应长度后,准确率降至随机水平。因果操控实验(n=20 随机对照)未发现几何与推理模式之间的功能联系(p=0.286)。

该结果对大量声称"模型学习到不同推理类型不同表征"的探针研究构成系统性挑战——高探针准确率反映的是任务格式(选项数、文本长度、来源风格)而非计算结构,建议在机制可解释性研究中将格式去混杂作为常规步骤。

来源:arXiv《Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States》(2026-06-03)https://arxiv.org/abs/2606.02907

新基准

AgentRedBench:215 场景 × 24 企业集成 × 5 攻击类型的动态红队基准

AgentRedBench(arXiv:2606.02240,v2 更新于 6 月 3 日)针对 LLM Agent 在 SaaS 集成中的间接提示注入威胁,构建了 215 个细微的"授权不足"攻击场景,覆盖 24 个企业集成(Gmail、Salesforce、Jira 等)、9 个功能族和 5 种攻击类型。在 8 模型面板(Anthropic、OpenAI、Google)上,无防护 ASR(攻击成功率)从 32%(Claude Sonnet 4.6)到 81%(Gemini 3 Flash)不等。

随基准同时发布的 AGENTREDGUARD 将面板 ASR 从 69.9% 降至 2.4%,误报率仅 0.37%,全面优于 Llama Guard、PromptGuard 2、ProtectAI 等开源基线。为防止场景泄漏到训练语料,规范场景通过维护者介导通道以不可变版本化方式评估。

来源:arXiv《AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations》(2026-06-03,v2)https://arxiv.org/abs/2606.02240

RUT-Bench:真实用户工具调用——19 个 LLM 无一超过 40% 成功率

RUT-Bench(arXiv:2606.03318,提交于 6 月 3 日)填补了现有工具调用评测的关键空白:现有基准依赖理想化用户假设,忽视真实用户的歧义表达、不合作行为和意图漂移。RUT-Bench 支持理想理性模式与异构非理想行为的高保真模拟,涵盖单轮和多轮对话。

在 19 个开源和闭源 LLM 上的评测结果令人警醒:无一模型总体成功率超过 40%,且几乎所有模型在面对非理想用户输入时性能显著下降。该结果与 RealClawBench 相互印证:当前模型在从"静态指令-API 映射"到"真实动态交互"之间存在系统性能差。

来源:arXiv《Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions》(2026-06-03)https://arxiv.org/abs/2606.03318

ContinuousBench:按季度自动更新的 DP 合成文本评测——SOTA DP 方法在 ε=100 时仍无法传递知识

ContinuousBench(arXiv:2606.01849,v2 更新于 6 月 3 日)是一个持续自动再生的基准,用于测量差分隐私(DP)合成文本的能力增益。每个季度发布全新的训练语料和衍生 QA 集,设计为:(1) 无训练语料时无法解答;(2) 在 DP 下可学习(知识由数百条独立记录支撑)。设两个赛道:Geminon(虚构生物的程序化生成数据集)和 News(新爬取的公开新闻)。

核心发现:非隐私合成可以传递大量知识,但 SOTA DP 合成方法即使在 ε=100 的宽松隐私预算下仍然普遍失败。该基准直接回应了一个关键问题:DP 合成文本能否真正替代原始数据访问——当前答案是否定的,且标准 benchmark 因接近饱和而无法区分这一差异。

来源:arXiv《ContinuousBench: Can Differentially Private Synthetic Text Improve Capabilities?》(2026-06-03,v2)https://arxiv.org/abs/2606.01849

EntSQL:企业级长上下文 Text-to-SQL 基准——最佳系统仅 15.9%

EntSQL(arXiv:2606.03363,提交于 6 月 3 日)面向企业场景中 SQL 生成需依赖私有业务知识(内部指标、报告惯例、组织规则)这一被现有基准忽略的维度。包含 1,066 个中英对齐语义示例,覆盖 5 个业务领域,大多数示例需要 schema 之外的领域知识且涉及复杂 SQL 结构。在英文输入上,提供长文档后最佳系统仅达 15.9%,凸显企业知识锚定 SQL 生成的巨大难度。

来源:arXiv《EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge》(2026-06-03)https://arxiv.org/abs/2606.03363


本期说明:窗口(6 月 1 日–4 日)内可核对的评测与基准条目以 6 月 3 日 arXiv 提交为主。重点覆盖:(1) 榜单动态——LiveBench 最新排名与 RealClawBench 真实场景评测;(2) 评测方法论危机——CoEval 的无污染方案、EvalAwareBench 的评测意识问题、FOLIO/MALLS 标注错误审计、LLM-as-Judge 几何偏差、Linear Probes 格式混杂等五项发现分别从数据污染、模型行为、标注质量、裁判可靠性和探针有效性五个维度冲击现有评测范式;(3) 新基准——AgentRedBench(红队安全)、RUT-Bench(真实工具调用)、ContinuousBench(DP 合成评测)、EntSQL(企业 Text-to-SQL)。上期已覆盖的 SMH-Bench、LongJudgeBench、MLCommons InclusiveAI 等不再重复。

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • S2:视觉-语言-动作模型泛化能力大幅提升——\\\"少看多描述\\\"策略使真实机器人成功率提高24.8个百分点S2:视觉-语言-动作模型泛化能力大幅提升——\"少看多描述\"策略使真实机器人成功率提高24.8个百分点Daily · 6月4日
  • NVIDIA RTX Spark 与 Microsoft Build 同日亮剑,「AI 原生 PC」从概念变成产品NVIDIA RTX Spark 与 Microsoft Build 同日亮剑,「AI 原生 PC」从概念变成产品Daily · 6月3日
  • Anthropic 向 SEC 秘密提交 IPO 申请,AI 最大独角兽争相抢滩公开市场Anthropic 向 SEC 秘密提交 IPO 申请,AI 最大独角兽争相抢滩公开市场Daily · 6月2日
  • DeepSWE:全新长周期软件工程基准——GPT-5.5 以 70% 领跑,DeepSeek V4 Pro 仅 8%DeepSWE:全新长周期软件工程基准——GPT-5.5 以 70% 领跑,DeepSeek V4 Pro 仅 8%Daily · 6月1日
  • AI 企业级成本清算:Microsoft 砍 Claude Code、Uber 四个月烧光全年预算AI 企业级成本清算:Microsoft 砍 Claude Code、Uber 四个月烧光全年预算Daily · 5月31日
  • FormInv:数学推理基准的语义不变性审计——\\\"No-Free-Benchmark\\\"定理FormInv:数学推理基准的语义不变性审计——\"No-Free-Benchmark\"定理Daily · 5月30日
  • XCENA 面向 AI 系统设计的内存芯片与电路板XCENA 融资 1.35 亿美元,押注 AI 的下一瓶颈是内存Daily · 5月29日
  • 一名人物侧身拿着手机与 Sesame 语音助手对话Sesame 推出 iOS 应用,实时语音 Agent 进入移动端Daily · 5月28日
  • Robinhood Agentic Trading 产品界面展示账户与交易操作Robinhood 让 AI Agent 交易股票,权限设计开始直接影响余额Daily · 5月27日
  • 多个人工智能助手站在分割的平台上的概念插画严格窗口内未发现足以成条的 AI 产业新增Daily · 5月26日
  • 教宗 Leo XIV 在公开活动中讲话教宗 AI 通谕把问题转向劳动、文化与收益分配Daily · 5月25日
  • Amazon Bee 可穿戴助手的手机端应用界面Amazon Bee 把持续记录带进可穿戴设备Daily · 5月24日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS