CoEval:零污染、零人工标注的 benchmark 生成框架——4 任务 7,978 次评测仅 $5.89
CoEval(arXiv:2606.03650,提交于 6 月 3 日)提出了一套端到端框架:仅凭任务描述,由教师模型合成属性可控的新 benchmark,每次运行生成全新题目,确保零污染。其生成题目与五大主流公开 benchmark 的 13-gram 逐字重叠为零。由跨模型家族的裁判团进行排序,无需人工校准。
关键发现:(1) 裁判团可靠性取决于厂商多样性而非规模——一个小而精的跨家族裁判团最可靠;(2) 单一裁判可能与真实排序反相关(judge-choice regret 0.35),而裁判团从不出现此问题;(3) 在有真实标签的验证中,CoEval 恢复真实模型排名的 ho=0.86。该框架意味着任何团队都可以为自己的应用场景按需生成无污染 leaderboard,且成本极低($5.89/四任务)。
来源:arXiv《CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks》(2026-06-03)https://arxiv.org/abs/2606.03650
EvalAwareBench:前沿模型会"察觉"自己在被评测——安全评测有效性首当其冲
多机构联合团队(含 Maksym Andriushchenko 等)将"评测意识"(evaluation awareness)基于社会心理学框架分解为环境成分(8 个触发因子,如占位实体、评分格式输出样式)和模型成分(识别 vs 行为响应)。在 9 个前沿模型和 4 个 benchmark 上,识别率取决于模型与 benchmark 的具体配对,而非任一单独因素。
核心发现:识别很少导致行为改变,且当改变发生时,方向取决于感知到的评测类型。模型对安全评测比能力评测更敏感,意味着安全基准的有效性面临更大风险。为此提出了 EvalAwareBench——100 个配对的安全-能力任务,8 个因子可独立开关。实验表明:没有单一因子对所有模型统一生效,但叠加因子会逐步提高所有模型的评测意识。该研究为评测污染提供了一个新维度:不仅是数据泄漏,模型本身可能在"配合演出"。
来源:arXiv《Decomposing and Measuring Evaluation Awareness》(2026-06-03,v2 更新)https://arxiv.org/abs/2605.23055
FOLIO/MALLS 审计:39% 与 36% 标注错误,修正后模型准确率提升 9–22 个百分点
自然语言到一阶逻辑(NL-to-FOL)转换是神经符号 AI 和自然语言推理的基础,但 FOLIO 和 MALLS 这两个关键 benchmark 从未被系统审计。Brunello 等人的工作(arXiv:2606.02837,提交于 6 月 3 日)首次进行了人工系统审查:FOLIO 验证集约 39% 条目含错误 FOL 形式化(即 ground truth 标签),MALLS 测试子集约 36%。此外 FOLIO 中 16.4% 的自然语言句子歧义、8.4% 的 NLI 标签错误。
使用修正后的 ground truth 重新评测三款 SOTA LLM(Gemma 4 31B-it、Qwen3-30B-A3B、GPT-4o-mini),准确率提升 9 到 22 个百分点。团队进一步提出 LLM 辅助框架,将人工审查引导至最高错误密度的实例,只需审查不到 24% 的实例即可达到 90% 数据集准确率(无引导则需 70%+)。该发现对依赖 NL-to-FOL 基准的研究方向(如形式推理、定理证明)有直接冲击——此前报告的"进步"可能部分来自在错误标签上的过拟合。
来源:arXiv《Fixing FOLIO and MALLS: Verified Annotations and an LLM-assisted Framework to Focus Human Relabeling》(2026-06-03)https://arxiv.org/abs/2606.02837
LLM-as-Judge 几何分析:LLM 裁判间的高共识反映的是"塌缩子空间内的一致",而非人类对齐
LLM-as-Judge 已成为标准实践,但裁判间高度一致而裁判与人类仅弱一致的现象长期缺乏解释。Mukherjee 等人的工作(arXiv:2606.03043,提交于 6 月 3 日)在 4 个社区构建的 Indic 数据集、8 种 Indic 语言和 41 个 LLM 裁判上测量了四个几何量:分数散布、有效秩、与人类子空间的主角度、裁判间-裁判与人之间的堆叠相关性。
在主观评分标准上,LLM 裁判使用的分数范围不到人类的一半(σ_J/σ_H ≈ 0.3–0.5),其评分轴与人类近乎正交(87°–89°),比人类间差异(78°–81°)更大。LLM 间相关性(r_LL ≈ 0.35)高于 LLM-人类相关性(r_LH ≈ 0.27–0.32)。在可验证事实的评分标准上,相同诊断指标回到人类范围(轴 58.5°;r_LH = 0.519)。微调和偏好优化可恢复分数散布(0.32→1.08)但几乎不移动评分轴(仍 87°–88°)。仅后验校准(在小型人类锚定集上)能同时改善四个社区健康评分标准,使校准后的 24B Indic 裁判(r=0.184)超越 GPT-5.5(r=0.123),但仍远低于人类可靠性(人类-人类 r=0.474)。
来源:arXiv《The Geometry of LLM-as-Judge: Why Inter-LLM Consensus Is Not Human Alignment》(2026-06-03)https://arxiv.org/abs/2606.03043
Linear Probes:100% 跨验证准确率探出的是任务格式,而非推理模式
Sahoo 等人的工作(arXiv:2606.02907,提交于 6 月 3 日)对 Qwen3-14B 在 LogiQA 2.0(演绎)、ARC-Challenge(归纳)和 αNLI(溯因)三个基准上使用线性探针。在第 32/40 层,线性探针达到 100% 跨验证准确率且几何分离良好。但残差化来源标识、选项数量和响应长度后,准确率降至随机水平。因果操控实验(n=20 随机对照)未发现几何与推理模式之间的功能联系(p=0.286)。
该结果对大量声称"模型学习到不同推理类型不同表征"的探针研究构成系统性挑战——高探针准确率反映的是任务格式(选项数、文本长度、来源风格)而非计算结构,建议在机制可解释性研究中将格式去混杂作为常规步骤。
来源:arXiv《Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States》(2026-06-03)https://arxiv.org/abs/2606.02907