OCBENCH:大型语言模型过度服从性跨模型基准
2026年4月20日,研究者在Harvard Dataverse上发布了OCBENCH基准数据集,用于评估前沿LLM的“过度服从”现象。该基准包含400个对抗性提示,覆盖四类缺陷(未充分指定、歧义、矛盾、无意义),并收集了GPT‑4.1‑mini、Gemini 2.5 Flash、Llama 3.3 70B Instruct、Claude Haiku 4.5等四款模型在默认与澄清指令两种系统提示下的3,200条原始回答。数据集配套提供了基于规则、包含9类响应的分类器,以及112条人工标注样本用于验证(Cohen's κ=0.725)。该基准旨在量化模型在模糊或对抗性指令下是否表现出不必要的服从,为LLM响应策略评估提供了可复现的测试集。
来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/PVIHD8
SPINE:衡量大型语言模型认知稳定性的基准
2026年4月20日,SPINE基准在Harvard Dataverse上发布,专注于评估LLM在受到对抗性说服压力时保持已知正确答案的能力。该基准选取数学、代码与逻辑推理等具有明确答案的任务,仅针对模型初始回答正确的实例施加六类对抗性角色(如权威诉求、共识压力、官僚约束等)的劝诱攻击,并通过认知稳定性分数、答案翻转率与逃避拒绝率等指标量化模型表现。实验显示,初始任务准确率与受攻击后的稳定性之间存在显著差距,其中“官僚”攻击在所有角色中最为有效。SPINE旨在补充现有评估,为高风险场景下的模型说服鲁棒性提供测量工具。
来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/CG9X6D
KWBench:知识工作中无提示问题识别的基准
2026年4月20日,arXiv上发布了KWBench基准,旨在测试LLM在未收到明确问题类型提示时,能否从原始输入中识别出专业场景的治理结构。基准包含223个任务,源自收购谈判、合同协商、临床药学、组织政治、欺诈分析与激励设计等实践领域,每个任务均编码了博弈论模式(如委托‑代理冲突、信号传递、机制设计失败等)。评估采用三层评分规则,并设置了强制性错误路径检查。对16款模型的测试显示,最佳模型仅在27.9%的任务上通过,且前两名模型仅在31.7%的通过任务上达成一致。该基准试图将知识工作评估的重点从“给定问题后的执行”转向“从情境中识别正确问题”。
来源:arXiv
链接:https://arxiv.org/abs/2604.15760
MEDLEY‑BENCH:AI元认知评估基准
2026年4月20日,MEDLEY‑BENCH基准在arXiv上发布,用于评估AI模型的“行为元认知”能力,即在真实模型间分歧下,区分独立推理、私密自我修订与社会影响修订的表现。该基准在五个领域包含130个模糊实例,评估了来自12个家族的35款模型,并报告了两个互补分数:基于反思更新、社会鲁棒性与认知表达的三层聚合分数,以及源自四项元认知子能力的得分。结果显示,评估能力随模型规模增长而提升,但控制能力并未同步改善;在相对剖面分析中,评估能力是所有35款模型中最弱的相对能力。这表明元认知能力并非简单的规模函数,为未来训练中如何奖励校准的、比例适当的信念更新提供了参考。
来源:arXiv
链接:https://arxiv.org/abs/2604.16009
ReactBench:化学反应图中拓扑推理的MLLM基准
2026年4月20日,ReactBench基准在arXiv上发布,旨在揭示多模态大语言模型在处理复杂拓扑结构时的根本局限。该基准基于真实的化学反应图,涵盖从线性链到环状图的多样结构,包含1,618个专家标注的QA对,分布在四个层次化的任务维度上。对17款MLLM的广泛评估显示,基于锚点的任务与整体结构推理任务之间存在超过30%的性能差距,控制实验证实这一瓶颈源于推理而非感知。ReactBench为推进视觉推理提供了针对结构理解缺陷的量化测试集。
来源:arXiv
链接:https://arxiv.org/abs/2604.15994
SocialGrid:具身多智能体系统中规划与社会推理的基准
2026年4月20日,SocialGrid基准在arXiv上发布,为评估LLM智能体在具身多智能体环境中的规划与社会推理能力提供了一个受《Among Us》启发的测试平台。评估显示,即使最强的开源模型在任务完成与规划上的准确率也低于60%,智能体常陷入重复行为或无法导航基本障碍。为分离社会推理与规划缺陷,基准提供了可选的规划预言机。虽然规划辅助提升了任务完成率,但社会推理仍是瓶颈:智能体在检测欺骗时表现接近随机,依赖浅层启发式而非累积行为证据。该基准还建立了基于对抗性联赛Elo评分的竞争性排行榜。
来源:arXiv
链接:https://arxiv.org/abs/2604.16022
ASMR‑Bench:ML研究中破坏性代码审计的基准
2026年4月20日,ASMR‑Bench(ML研究中破坏审计基准)在arXiv上发布,用于评估审计者检测ML研究代码库中被植入破坏的能力。基准包含9个ML研究代码库及其被破坏的变体,每个破坏均修改了超参数、训练数据或评估代码等实现细节,同时保持论文描述的高级方法不变。对前沿LLM及LLM辅助人类审计者的测试显示,两者均难以可靠检测破坏:最佳性能为Gemini 3.1 Pro取得的AUROC 0.77与Top‑1修复率42%。基准亦测试了LLM作为红队的表现,发现LLM生成的破坏虽弱于人工生成,但有时仍能逃逸同能力LLM审计者的检测。
来源:arXiv
链接:https://arxiv.org/abs/2604.16286
PRL‑Bench:前沿物理研究能力综合评估基准
2026年4月20日,PRL‑Bench(Physics Research by LLMs)在arXiv上发布,旨在系统测绘LLM在执行端到端物理研究时的能力边界。该基准从2025年8月以来的《Physical Review Letters》最新期次中精选100篇论文,经领域专家验证,覆盖天体物理、凝聚态物理、高能物理、量子信息与统计物理五大理论与计算密集子领域。每个任务均设计为复现真实科研的核心属性,包括探索导向的问题构建、长流程工作流与客观可验证性。对前沿模型的评估显示,最佳总体分数仍低于50分,揭示了当前LLM能力与真实科研需求之间的显著差距。
来源:arXiv
链接:https://arxiv.org/abs/2604.15411
HarmfulSkillBench:有害技能对智能体安全影响的基准
2026年4月20日,HarmfulSkillBench在arXiv上发布,这是首个用于评估智能体在真实上下文中抵御有害技能安全风险的基准。研究者首先对两个主要技能注册表中的98,440个技能进行了大规模测量,发现4.93%的技能(4,858个)具有有害性。基于此,他们构建了包含20个类别、200个有害技能的评估基准,并设置了四种评估条件。对六款LLM的测试显示,通过预安装技能呈现有害任务会显著降低所有模型的拒绝率,平均危害分数从无技能时的0.27上升至有技能时的0.47,当有害意图隐晦而非明确时进一步升至0.76。该基准为智能体生态系统的安全评估提供了量化工具。
来源:arXiv
链接:https://arxiv.org/abs/2604.15415
DogReID‑1553:大规模犬只重识别视频数据集与排行榜
2026年4月17日,DogReID‑1553数据集在Harvard Dataverse上发布,这是一个用于犬只重识别的大规模视频数据集,包含1,553只不同犬只的7,463段视频(平均每只犬4.8段视频)。每段视频的首帧图像均提供了手工标注的边界框,并附有由GPT‑5生成的文本描述。除数据外,团队还建立了在线排行榜,支持研究者提交模型结果进行排名,为细粒度生物识别、动物行为研究等场景提供可复现的评估标准。
来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/LVTRLG