IndustryBench:工业采购 QA 基准,安全违规检查重排榜单,GPT-5.4 从第 6 升至第 3
5 月 13 日发布的 IndustryBench 是一个面向中文工业采购场景的 2,049 题 QA 基准,以中国国家标准(GB/T)和结构化工业产品记录为锚点,覆盖 7 个能力维度、10 个行业类别。其构建管线在外部验证阶段拒绝了 70.3% 的 LLM 生成候选,揭示了仅靠 LLM 过滤的工业 QA 不可靠程度。
评测将原始正确性(Qwen3-Max judge,与领域专家 κ_w = 0.798)与独立的安全违规(SV)检查解耦。17 个中文模型和 8 个跨语言模型的结果显示:(1) 最优系统在 0–3 评分制上仅达 2.083;(2) "标准与术语"是最持久的能力短板,跨语言翻译后依然存在;(3) 扩展推理降低了 13 个模型中 12 个的安全调整分数——更长的答案引入了无依据的安全关键细节;(4) SV 调整后 GPT-5.4 从第 6 升至第 3,Kimi-k2.5-1T-A32B 下降 7 位。结论:工业 LLM 评测需要来源锚定、安全感知的诊断,而非聚合准确率。
来源:arXiv《IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs》(2026-05-13)https://arxiv.org/abs/2605.10267
TraceEval:首个执行验证的多语言代码语义推理基准,Claude-Opus-4.6 达 72.9% F1
5 月 13 日发布的 TraceEval 是首个执行验证的多语言代码语义推理基准,任务是从源码恢复程序的运行时调用结构。与依赖静态工具或人工标注的调用图基准不同,TraceEval 中每条正向边均由验证执行机械见证,消除了标注分歧和标签噪声。基准包含从 1,600+ 开源仓库中提取的 10,583 个真实程序(2,129 测试 / 8,454 训练),覆盖 Python、JavaScript 和 Java。
10 个 LLM 零样本评测中,Claude-Opus-4.6 跨三种语言平均 F1 达 72.9%。Qwen2.5-Coder 系列微调后最高提升 +55.6 F1,Qwen2.5-Coder-32B 达 71.2%,仅落后零样本 Claude-Opus-4.6 1.7 F1。基准还提供可复现管线,可将任意开源仓库转化为新的验证实例。
来源:arXiv《An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning》(2026-05-13)https://arxiv.org/abs/2605.11006
MEME:多实体记忆评测,所有系统在依赖推理上崩溃(Cascade 3%、Absence 1%)
5 月 13 日发布的 MEME 定义了 6 项任务,覆盖多实体和演化两个轴的全空间,包括此前未被评测的三项:Cascade 和 Absence(依赖推理)以及 Deletion(移除后状态)。在 100 个受控 episode 上评测 6 个记忆系统(三种记忆范式),所有系统在默认配置下依赖推理崩溃——Cascade 平均准确率 3%、Absence 1%——尽管静态检索表现尚可。
提示优化、更深检索、减少填充噪声以及大多数更强的 LLM 均无法弥合这一差距。仅文件型 agent 搭配 Claude Opus 4.7 部分缩小差距,但成本约为基线的 70 倍,表明当前闭合方案在规模上不可行。
来源:arXiv《MEME: Multi-entity & Evolving Memory Evaluation》(2026-05-13)https://arxiv.org/abs/2605.12477
AgentCollabBench:多 agent 协作诊断基准,通信拓扑解释 7–40% 的信息存活方差
5 月 12 日发布的 AgentCollabBench 含 900 个人工验证任务,覆盖软件工程、DevOps 和数据工程,每个任务隔离四种行为风险之一:指令衰减、虚假信念传染、上下文泄漏和追踪耐久性。评测四个现代 LLM 后揭示了仅靠结果评测无法看到的模型特异性漏洞画像。
关键发现:通信拓扑是主要风险因素,解释多跳信息存活中 7–40% 的方差。效应源于汇聚 DAG 节点的"综合瓶颈"——agent 在权衡竞争父输入时丢弃少数分支携带的约束,而线性链中不存在此瓶颈。结论:多 agent 可靠性本质上是结构问题,仅靠扩展模型智能无法替代架构设计。
来源:arXiv《AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators》(2026-05-12)https://arxiv.org/abs/2605.08647
AcuityBench:临床紧急度识别基准,对话式回复减少过度分诊但增加漏诊
5 月 13 日发布的 AcuityBench 统一了五个公开数据集(用户对话、论坛帖子、临床案例、患者门户消息),在四级紧急度框架下评估模型识别就医紧迫性的能力。基准含 914 个案例,其中 697 个共识案例用于标准准确率评测,217 个医生确认的模糊案例用于不确定性感知评测。
12 个前沿模型的结果显示:对话式回复相比 QA 格式减少过度分诊但增加漏诊,尤其在高紧急度案例中;在模糊案例上,无一模型接近医生判断分布,模型预测比专家临床不确定性更集中。紧急度识别被定位为独立的安全关键能力。
来源:arXiv《AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment》(2026-05-13)https://arxiv.org/abs/2605.11398