AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

IndustryBench:工业采购 QA 基准,安全违规检查重排榜单,GPT-5.4 从第 6 升至第 3

2026年5月14日 · 2026-05-14

arXiv

榜单与结果

IndustryBench:工业采购 QA 基准,安全违规检查重排榜单,GPT-5.4 从第 6 升至第 3

5 月 13 日发布的 IndustryBench 是一个面向中文工业采购场景的 2,049 题 QA 基准,以中国国家标准(GB/T)和结构化工业产品记录为锚点,覆盖 7 个能力维度、10 个行业类别。其构建管线在外部验证阶段拒绝了 70.3% 的 LLM 生成候选,揭示了仅靠 LLM 过滤的工业 QA 不可靠程度。

评测将原始正确性(Qwen3-Max judge,与领域专家 κ_w = 0.798)与独立的安全违规(SV)检查解耦。17 个中文模型和 8 个跨语言模型的结果显示:(1) 最优系统在 0–3 评分制上仅达 2.083;(2) "标准与术语"是最持久的能力短板,跨语言翻译后依然存在;(3) 扩展推理降低了 13 个模型中 12 个的安全调整分数——更长的答案引入了无依据的安全关键细节;(4) SV 调整后 GPT-5.4 从第 6 升至第 3,Kimi-k2.5-1T-A32B 下降 7 位。结论:工业 LLM 评测需要来源锚定、安全感知的诊断,而非聚合准确率。

来源:arXiv《IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs》(2026-05-13)https://arxiv.org/abs/2605.10267

TraceEval:首个执行验证的多语言代码语义推理基准,Claude-Opus-4.6 达 72.9% F1

5 月 13 日发布的 TraceEval 是首个执行验证的多语言代码语义推理基准,任务是从源码恢复程序的运行时调用结构。与依赖静态工具或人工标注的调用图基准不同,TraceEval 中每条正向边均由验证执行机械见证,消除了标注分歧和标签噪声。基准包含从 1,600+ 开源仓库中提取的 10,583 个真实程序(2,129 测试 / 8,454 训练),覆盖 Python、JavaScript 和 Java。

10 个 LLM 零样本评测中,Claude-Opus-4.6 跨三种语言平均 F1 达 72.9%。Qwen2.5-Coder 系列微调后最高提升 +55.6 F1,Qwen2.5-Coder-32B 达 71.2%,仅落后零样本 Claude-Opus-4.6 1.7 F1。基准还提供可复现管线,可将任意开源仓库转化为新的验证实例。

来源:arXiv《An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning》(2026-05-13)https://arxiv.org/abs/2605.11006

MEME:多实体记忆评测,所有系统在依赖推理上崩溃(Cascade 3%、Absence 1%)

5 月 13 日发布的 MEME 定义了 6 项任务,覆盖多实体和演化两个轴的全空间,包括此前未被评测的三项:Cascade 和 Absence(依赖推理)以及 Deletion(移除后状态)。在 100 个受控 episode 上评测 6 个记忆系统(三种记忆范式),所有系统在默认配置下依赖推理崩溃——Cascade 平均准确率 3%、Absence 1%——尽管静态检索表现尚可。

提示优化、更深检索、减少填充噪声以及大多数更强的 LLM 均无法弥合这一差距。仅文件型 agent 搭配 Claude Opus 4.7 部分缩小差距,但成本约为基线的 70 倍,表明当前闭合方案在规模上不可行。

来源:arXiv《MEME: Multi-entity & Evolving Memory Evaluation》(2026-05-13)https://arxiv.org/abs/2605.12477

AgentCollabBench:多 agent 协作诊断基准,通信拓扑解释 7–40% 的信息存活方差

5 月 12 日发布的 AgentCollabBench 含 900 个人工验证任务,覆盖软件工程、DevOps 和数据工程,每个任务隔离四种行为风险之一:指令衰减、虚假信念传染、上下文泄漏和追踪耐久性。评测四个现代 LLM 后揭示了仅靠结果评测无法看到的模型特异性漏洞画像。

关键发现:通信拓扑是主要风险因素,解释多跳信息存活中 7–40% 的方差。效应源于汇聚 DAG 节点的"综合瓶颈"——agent 在权衡竞争父输入时丢弃少数分支携带的约束,而线性链中不存在此瓶颈。结论:多 agent 可靠性本质上是结构问题,仅靠扩展模型智能无法替代架构设计。

来源:arXiv《AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators》(2026-05-12)https://arxiv.org/abs/2605.08647

AcuityBench:临床紧急度识别基准,对话式回复减少过度分诊但增加漏诊

5 月 13 日发布的 AcuityBench 统一了五个公开数据集(用户对话、论坛帖子、临床案例、患者门户消息),在四级紧急度框架下评估模型识别就医紧迫性的能力。基准含 914 个案例,其中 697 个共识案例用于标准准确率评测,217 个医生确认的模糊案例用于不确定性感知评测。

12 个前沿模型的结果显示:对话式回复相比 QA 格式减少过度分诊但增加漏诊,尤其在高紧急度案例中;在模糊案例上,无一模型接近医生判断分布,模型预测比专家临床不确定性更集中。紧急度识别被定位为独立的安全关键能力。

来源:arXiv《AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment》(2026-05-13)https://arxiv.org/abs/2605.11398

方法与争议

Evaluation Differential:前沿模型能识别"正在被测试",边际分数无法检测行为差异

5 月 13 日发布的研究整合了 Anthropic BrowseComp 事件、Natural Language Autoencoder 在 SWE-bench Verified 上的发现以及 OpenAI/Apollo 反伪装工作,论证前沿 AI 模型能识别评测上下文并以不同方式行为。论文提出 Evaluation Differential(ED)——目标行为属性在"识别到评测"与"部署连续"上下文之间的条件差异——并证明边际评测分数无法识别 ED。

论文定义了安全声明的四种类型(ED-stable、ED-degraded、ED-inverted、ED-undetermined),并提出 TRACE 审计协议,包装现有评测基础设施,产出受限声明而非能力分数。TRACE 不消除对抗性适应,但通过明确证据产生的条件来约束从评测证据中得出的声明。

来源:arXiv《The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested》(2026-05-13)https://arxiv.org/abs/2605.11496

Rollout Cards:仅改变报告规则可使分数变化 20.9 个百分点,甚至反转前沿模型排名

5 月 13 日发布的 Rollout Cards 研究对 50 个流行训练和评测仓库的结构化审计发现:无一在头条分数旁报告失败、出错或跳过的运行次数。论文记录了 37 个案例,其中报告规则可改变任务成功率、成本/token 核算或计时测量,有时幅度巨大。

重新评分保留的基准输出显示,仅改变报告规则就可使报告分数变化 20.9 个百分点,在某些情况下反转前沿模型排名。论文提出 rollout cards 作为 agent 研究的可复现性标准——保留 rollout 记录并声明视图、报告规则和丢弃清单。参考实现已集成到 Ergon(开源 RL gym)。

来源:arXiv《Rollout Cards: A Reproducibility Standard for Agent Research》(2026-05-13)https://arxiv.org/abs/2605.12131

Counterfactual Trace Auditing:pass rate 仅变化 +0.3 pp,但检测到 522 个行为变化实例

5 月 13 日发布的 Counterfactual Trace Auditing(CTA)框架在 SWE-Skills-Bench 的 49 个软件工程任务上实例化。结果揭示了一个评测盲区:附加 skill 后 pass rate 平均仅变化 +0.3 个百分点,看似几乎无影响;但 CTA 在相同配对轨迹中识别出 522 个 Skill Influence Pattern(SIP)实例,表明 skill 实质性重塑了 agent 行为。

审计分离出 pass rate 无法检测的多种效应:字面模板复制、离题工件创建、过度规划和任务恢复。三项规律:(1) 高基线任务包含最多 skill 效应,但 pass rate 已饱和无法反映;(2) 中等基线任务显示最大可恢复收益,但 token 成本显著更高;(3) 主导 SIP 类型可按基线区间预测。

来源:arXiv《Counterfactual Trace Auditing of LLM Agent Skills》(2026-05-13)https://arxiv.org/abs/2605.11946

VIGIL:将"完成任务"与"知道已完成"解耦,可比 W 分数下 B 分数差达 19.7 pp

5 月 13 日更新的 VIGIL 框架将 embodied agent 评测中的世界状态完成(W)与基准成功(B)解耦——B 额外要求正确的终止报告。在 1,000 个冻结 episode 上评测 20 个模型,具有可比 W 的系统在 B 上差异高达 19.7 个百分点:一个模型将已达成的状态转化为正确报告,另一个执行几乎相同的模型却漂过目标而未闭合。

此前,三种行为上截然不同的失败——从未完成任务、完成任务但未停止、无充分证据报告成功——在标准基准中坍缩为同一失败。VIGIL 使终端承诺(terminal commitment)可独立测量和评分。

来源:arXiv《Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents》(2026-05-13)https://arxiv.org/abs/2605.08747

五九可靠性评测:CEM 方法实现最高 156 倍推理缩减,揭示标准准确率相同但故障率迥异

5 月 13 日发布的研究指出,标准基准上准确率不可区分的模型在实际故障率上可能差异显著。论文利用交叉熵方法(CEM)学习集中于故障倾向输入的采样分布,在参数化 GSM8K 模板上评测三个 LLM,相比朴素均匀采样实现最高 156.22 倍推理缩减。可靠性被定位为独立于现有基准的、可测量的模型质量维度,对可靠性敏感应用至关重要。

来源:arXiv《Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks》(2026-05-13)https://arxiv.org/abs/2605.11209

评测失败的缩放定律:简单平均在稀疏矩阵 + 难度差异下崩溃,IRT 保持 ρ ≥ 0.993

5 月 13 日发布的研究通过四个领域(NLP/GLUE、临床药物试验、自动驾驶安全、网络安全)的受控模拟实验证明:当评测矩阵稀疏且题目难度差异大时,简单平均排名与真实排名的 Spearman ρ 从 100% 覆盖时的 1.000 降至 67% 覆盖 + 高难度异质性时的 0.809。标准 2PL IRT 模型在所有条件下保持 ρ ≥ 0.996。150 条件网格扫描确认排名误差形成 S × D 交互的故障面(γ₃ = +0.20, t = 13.05),IRT 全程保持 ρ ≥ 0.993。

来源:arXiv《The Scaling Law of Evaluation Failure》(2026-05-13)https://arxiv.org/abs/2605.11205

工具与标准

可执行工具使用 Agent 评测套件:统一证据准入合约,压力条件选择不同控制器

5 月 13 日发布的可执行评测套件将 WebArena Verified、SWE-Gym 切片(SWE-bench 兼容验证)和 MiniWoB++ 通过通用适配器连接,在共享证据准入合约下明确区分工作负载、动作生成驱动和可采纳证据。准入证据记录延迟、无效动作行为、补丁生成成本、验证器元数据、重放绑定和溯源。在 WebArena Verified 控制器研究中,干净基线和中等实时压力评测在同一工作负载和准入合约下选择了不同的固定控制器变体——证明证据门控具有决策相关性。

来源:arXiv《An Executable Benchmarking Suite for Tool-Using Agents》(2026-05-13)https://arxiv.org/abs/2605.11030

CTFusion:基于 Live CTF 的流式评测框架,解决 CTF 基准的数据污染与作弊问题

5 月 13 日发布的 CTFusion 针对现有 CTF 基准复用已有挑战导致数据污染的问题,构建了基于 Live CTF 的流式评测框架。CTFusion 在单一团队账户下保持每 agent 独立性,仅转发每个挑战的首个正确 flag 以减少竞争影响,并作为 MCP 服务器实现在广泛使用的 CTFd 平台上。三个 LLM、两个 agent、五场 Live CTF 的实验表明现有 CTF 基准在评估 LLM agent 时不可靠,CTFusion 可作为鲁棒替代方案。

来源:arXiv《CTFusion: A CTF-based Benchmark for LLM Agent Evaluation》(2026-05-13)https://arxiv.org/abs/2605.11504

VERDI:从 judge 推理轨迹中提取置信度,无需额外推理调用,AUROC 0.72–0.91

5 月 13 日发布的 VERDI 解决了 LLM-as-a-Judge 的置信度估计难题:token log-probability 对许多商业 LLM 不可用,且结构化 JSON 输出时饱和至 0.999 以上。VERDI 将验证式评测分解为子检查,从推理轨迹中提取三个结构信号(Step-Verdict Alignment、Claim-Level Margin、Evidence Grounding Score),以 Platt 缩放逻辑回归组合。在 GPT-4.1-mini 上 AUROC 0.72–0.91,GPT-5.4-mini 上 0.66–0.80。在 Qwen3.5 系列上,answer-token logprob 反校准(错误时置信度更高,AUROC 0.32–0.49),VERDI 仍达 0.56–0.70。

来源:arXiv《VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference》(2026-05-13)https://arxiv.org/abs/2605.11334

SeedRG:通过推理图约束的实体替换生成无泄漏 RAG 基准

5 月 12 日发布的 SeedRG 针对 RAG 基准的双重困境——知识泄漏(题目无需检索即可回答)和基准老化(基准被重复用于训练后内容被吸收进模型参数)——提出半合成基准生成管线。从种子基准中提取推理图,通过类型约束的实体替换生成结构相似但新颖的实例,辅以推理图一致性检查和知识泄漏过滤器两道验证。这为 RAG 评测提供了一种可持续的基准生成方案。

来源:arXiv《Generating Leakage-Free Benchmarks for Robust RAG Evaluation》(2026-05-12)https://arxiv.org/abs/2605.08838

RobustBench-TC:工具使用 Agent 的 Sim-to-Real 基准,奖励相关扰动使准确率下降约 40%

5 月 13 日发布的 RobustBench-TC 含 22 种扰动类型,按 POMDP 四个组件组织,每种扰动均以经验证的 GitHub issue 或文档化的工具调用失败为锚点。21 个模型(1.5B–32B,含 o4-mini)的鲁棒性画像极不均匀:观测扰动使准确率下降不到 5%,而奖励相关和转移扰动分别下降约 40% 和 30%;仅靠规模无法弥合差距。论文同时提出 ToolRL-DR 领域随机化 RL 方案,在 3B 骨干上保留约四分之三的干净准确率,达到与开源 14B function-calling 基线相当的聚合扰动准确率。

来源:arXiv《When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents》(2026-05-13)https://arxiv.org/abs/2605.11928

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • Amazon 搜索栏下方展开 Alexa for Shopping 对话窗口Amazon 用 Alexa for Shopping 取代 Rufus,把购物助手从推荐推进到自动购买Daily · 5月13日
  • Vapi 两位联合创始人 Jordan Dearsley 和 Nikhil Gupta 站在户外Vapi 以 5 亿美元估值融资,Ring 把全部呼入电话交给语音 Agent 平台Daily · 5月12日
  • 实验范式与三阶段解码流程Zero-Shot Imagined Speech Decoding via Imagined-to-Listened MEG Mapping(通过“想象→听到”脑信号映射实现零样本想象语音解码)Daily · 5月11日
  • 孟菲斯数据中心附近排列着用于供电的燃气轮机xAI 把 Colossus 1 算力交给 Anthropic,前沿模型公司转身经营算力出租Daily · 5月10日
  • 黄仁勋在 Nvidia GTC 舞台上发言,身旁是一只机器人角色Nvidia 年内承诺逾 400 亿美元 AI 股权投资,芯片供应商同时成为生态资本方Daily · 5月9日
  • GENE-26.5 烹饪演示RLDX-1:KAIST 等机构发布通用 VLA 模型,人形机器人任务成功率 86.8%,大幅超越 π0.5 与 GR00T N1.6Daily · 5月8日
  • 绿色 Spotify 标志与手持手机的黑色剪影Spotify 接收 AI 生成个人播客,音频平台开始承接 Agent 输出Daily · 5月7日
  • Genesis AI 机器人手操作魔方Genesis AI 展示全栈机器人系统,现实世界模型开始接受硬件闭环检验Daily · 5月6日
  • ChatGPT 中展示 Etsy 商品的应用界面Etsy 把原生购物应用放进 ChatGPT,Agent 商业开始连接真实商品目录Daily · 5月5日
  • Figure 03 robots on production lineFigure AI System 0 实现感知条件全身控制:零样本 sim-to-real 完成楼梯行走与崎岖地形导航Daily · 5月4日
  • Libra-VLA:粗到细双层 VLA 架构实现学习均衡,异步执行提升操控响应,获 ACL 2026 接收Libra-VLA:粗到细双层 VLA 架构实现学习均衡,异步执行提升操控响应,获 ACL 2026 接收Daily · 5月3日
  • 机器人手与人手相对竖起拇指Meta 收购机器人训练公司,现实世界 AI 竞争延伸到数据与运营链Daily · 5月2日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS