AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

OCBENCH:大型语言模型过度服从性跨模型基准

2026年4月21日 · 2026-04-21

arXiv

榜单与结果

OCBENCH:大型语言模型过度服从性跨模型基准

2026年4月20日,研究者在Harvard Dataverse上发布了OCBENCH基准数据集,用于评估前沿LLM的“过度服从”现象。该基准包含400个对抗性提示,覆盖四类缺陷(未充分指定、歧义、矛盾、无意义),并收集了GPT‑4.1‑mini、Gemini 2.5 Flash、Llama 3.3 70B Instruct、Claude Haiku 4.5等四款模型在默认与澄清指令两种系统提示下的3,200条原始回答。数据集配套提供了基于规则、包含9类响应的分类器,以及112条人工标注样本用于验证(Cohen's κ=0.725)。该基准旨在量化模型在模糊或对抗性指令下是否表现出不必要的服从,为LLM响应策略评估提供了可复现的测试集。

来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/PVIHD8

SPINE:衡量大型语言模型认知稳定性的基准

2026年4月20日,SPINE基准在Harvard Dataverse上发布,专注于评估LLM在受到对抗性说服压力时保持已知正确答案的能力。该基准选取数学、代码与逻辑推理等具有明确答案的任务,仅针对模型初始回答正确的实例施加六类对抗性角色(如权威诉求、共识压力、官僚约束等)的劝诱攻击,并通过认知稳定性分数、答案翻转率与逃避拒绝率等指标量化模型表现。实验显示,初始任务准确率与受攻击后的稳定性之间存在显著差距,其中“官僚”攻击在所有角色中最为有效。SPINE旨在补充现有评估,为高风险场景下的模型说服鲁棒性提供测量工具。

来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/CG9X6D

KWBench:知识工作中无提示问题识别的基准

2026年4月20日,arXiv上发布了KWBench基准,旨在测试LLM在未收到明确问题类型提示时,能否从原始输入中识别出专业场景的治理结构。基准包含223个任务,源自收购谈判、合同协商、临床药学、组织政治、欺诈分析与激励设计等实践领域,每个任务均编码了博弈论模式(如委托‑代理冲突、信号传递、机制设计失败等)。评估采用三层评分规则,并设置了强制性错误路径检查。对16款模型的测试显示,最佳模型仅在27.9%的任务上通过,且前两名模型仅在31.7%的通过任务上达成一致。该基准试图将知识工作评估的重点从“给定问题后的执行”转向“从情境中识别正确问题”。

来源:arXiv
链接:https://arxiv.org/abs/2604.15760

MEDLEY‑BENCH:AI元认知评估基准

2026年4月20日,MEDLEY‑BENCH基准在arXiv上发布,用于评估AI模型的“行为元认知”能力,即在真实模型间分歧下,区分独立推理、私密自我修订与社会影响修订的表现。该基准在五个领域包含130个模糊实例,评估了来自12个家族的35款模型,并报告了两个互补分数:基于反思更新、社会鲁棒性与认知表达的三层聚合分数,以及源自四项元认知子能力的得分。结果显示,评估能力随模型规模增长而提升,但控制能力并未同步改善;在相对剖面分析中,评估能力是所有35款模型中最弱的相对能力。这表明元认知能力并非简单的规模函数,为未来训练中如何奖励校准的、比例适当的信念更新提供了参考。

来源:arXiv
链接:https://arxiv.org/abs/2604.16009

ReactBench:化学反应图中拓扑推理的MLLM基准

2026年4月20日,ReactBench基准在arXiv上发布,旨在揭示多模态大语言模型在处理复杂拓扑结构时的根本局限。该基准基于真实的化学反应图,涵盖从线性链到环状图的多样结构,包含1,618个专家标注的QA对,分布在四个层次化的任务维度上。对17款MLLM的广泛评估显示,基于锚点的任务与整体结构推理任务之间存在超过30%的性能差距,控制实验证实这一瓶颈源于推理而非感知。ReactBench为推进视觉推理提供了针对结构理解缺陷的量化测试集。

来源:arXiv
链接:https://arxiv.org/abs/2604.15994

SocialGrid:具身多智能体系统中规划与社会推理的基准

2026年4月20日,SocialGrid基准在arXiv上发布,为评估LLM智能体在具身多智能体环境中的规划与社会推理能力提供了一个受《Among Us》启发的测试平台。评估显示,即使最强的开源模型在任务完成与规划上的准确率也低于60%,智能体常陷入重复行为或无法导航基本障碍。为分离社会推理与规划缺陷,基准提供了可选的规划预言机。虽然规划辅助提升了任务完成率,但社会推理仍是瓶颈:智能体在检测欺骗时表现接近随机,依赖浅层启发式而非累积行为证据。该基准还建立了基于对抗性联赛Elo评分的竞争性排行榜。

来源:arXiv
链接:https://arxiv.org/abs/2604.16022

ASMR‑Bench:ML研究中破坏性代码审计的基准

2026年4月20日,ASMR‑Bench(ML研究中破坏审计基准)在arXiv上发布,用于评估审计者检测ML研究代码库中被植入破坏的能力。基准包含9个ML研究代码库及其被破坏的变体,每个破坏均修改了超参数、训练数据或评估代码等实现细节,同时保持论文描述的高级方法不变。对前沿LLM及LLM辅助人类审计者的测试显示,两者均难以可靠检测破坏:最佳性能为Gemini 3.1 Pro取得的AUROC 0.77与Top‑1修复率42%。基准亦测试了LLM作为红队的表现,发现LLM生成的破坏虽弱于人工生成,但有时仍能逃逸同能力LLM审计者的检测。

来源:arXiv
链接:https://arxiv.org/abs/2604.16286

PRL‑Bench:前沿物理研究能力综合评估基准

2026年4月20日,PRL‑Bench(Physics Research by LLMs)在arXiv上发布,旨在系统测绘LLM在执行端到端物理研究时的能力边界。该基准从2025年8月以来的《Physical Review Letters》最新期次中精选100篇论文,经领域专家验证,覆盖天体物理、凝聚态物理、高能物理、量子信息与统计物理五大理论与计算密集子领域。每个任务均设计为复现真实科研的核心属性,包括探索导向的问题构建、长流程工作流与客观可验证性。对前沿模型的评估显示,最佳总体分数仍低于50分,揭示了当前LLM能力与真实科研需求之间的显著差距。

来源:arXiv
链接:https://arxiv.org/abs/2604.15411

HarmfulSkillBench:有害技能对智能体安全影响的基准

2026年4月20日,HarmfulSkillBench在arXiv上发布,这是首个用于评估智能体在真实上下文中抵御有害技能安全风险的基准。研究者首先对两个主要技能注册表中的98,440个技能进行了大规模测量,发现4.93%的技能(4,858个)具有有害性。基于此,他们构建了包含20个类别、200个有害技能的评估基准,并设置了四种评估条件。对六款LLM的测试显示,通过预安装技能呈现有害任务会显著降低所有模型的拒绝率,平均危害分数从无技能时的0.27上升至有技能时的0.47,当有害意图隐晦而非明确时进一步升至0.76。该基准为智能体生态系统的安全评估提供了量化工具。

来源:arXiv
链接:https://arxiv.org/abs/2604.15415

DogReID‑1553:大规模犬只重识别视频数据集与排行榜

2026年4月17日,DogReID‑1553数据集在Harvard Dataverse上发布,这是一个用于犬只重识别的大规模视频数据集,包含1,553只不同犬只的7,463段视频(平均每只犬4.8段视频)。每段视频的首帧图像均提供了手工标注的边界框,并附有由GPT‑5生成的文本描述。除数据外,团队还建立了在线排行榜,支持研究者提交模型结果进行排名,为细粒度生物识别、动物行为研究等场景提供可复现的评估标准。

来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/LVTRLG

方法与争议

编码代理基准测试中脚手架适配的影响:同一Qwen 9B模型性能翻倍

2026年4月19日,一项在Reddit上分享的测试表明,编码代理的基准结果高度依赖脚手架(scaffold)与模型的匹配程度。作者固定使用Qwen3.5‑9B Q4权重,在相同的Aider Polyglot基准(225道练习题)上比较了默认Aider脚手架与针对小模型优化的“little‑coder”脚手架。结果,默认脚手架仅取得19.11%的pass@2,而优化后的脚手架达到45.56%,性能提升超过一倍。作者指出,在10B参数以下的本地模型中,编码代理的弱表现可能并非源于模型权重本身,而是由于脚手架与模型行为模式不匹配。这一发现提示,编码代理的评估需要同时考虑模型能力与脚手架适配性,否则可能过早低估小模型的潜力。

来源:Reddit
链接:https://www.reddit.com/r/LocalLLaMA/comments/1spufzz/same_9b_qwen_weights_191_in_aider_vs_456_with_a/

37模型叙事质量测评:小模型在桌游GM任务中超越大模型

2026年4月19日,开源项目open‑tabletop‑gm的作者发布了针对37款开源及社区精调模型的叙事质量测评结果。该测评设计了12个桌游GM(Game Master)场景,从氛围营造、NPC塑造、GM技巧三个维度,由5款不同家族的LLM组成评委团进行1‑5分打分,并计算评委间一致性。结果显示,27B参数的Gemma‑3‑27B‑it在自动评分(P:8/W:3/F:1)和评委平均分(4.75)上均表现优异,超越多款70B‑405B级别的大模型;而Mistral‑medium‑3.1以4.80分和IRA 0.50成为综合推荐首选。测评同时指出,社区流行的角色扮演精调模型在结构化场景评分中普遍低于基础模型,说明“氛围感”与“场景管理能力”之间存在评估差异。该测评开源了所有脚本与结果,为叙事生成任务的模型选择提供了基于多评委、多场景的量化参考。

来源:Reddit
链接:https://www.reddit.com/r/LocalLLaMA/comments/1spfz31/i_tested_8_llms_as_tabletop_gms_a_27b_model_beat/

工具与标准

vla‑eval:视觉‑语言‑动作模型的统一评估工具链与排行榜

2026年4月20日,研究者发布了vla‑eval,一个用于Vision‑Language‑Action模型的统一评估工具链。该工具通过WebSocket+msgpack协议与Docker环境隔离,将模型推理与基准执行解耦,使得模型只需实现一次predict()方法即可接入,基准也只需通过四方法接口集成,从而自动支持完整的交叉评估矩阵。框架目前支持14个仿真基准与六个模型服务器,并通过并行评估实现了高达47倍的加速(例如2,000个LIBERO episode可在约18分钟内完成)。为验证框架,研究者复现了六个VLA代码库在三个基准上的已发布分数,并记录了此前未公开的陷阱。此外,他们还发布了聚合17个基准、657项已发布结果的VLA排行榜,为社区提供了一站式的模型性能对比平台。

来源:arXiv
链接:https://arxiv.org/abs/2603.13966

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集Daily · 4月20日
  • DogReID‑1553:大规模犬只重识别视频数据集与基准测试Daily · 4月19日
  • 斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%Daily · 4月18日
  • Claude Design 名称与橙色 Claude 标志Claude Design 把快速视觉生成带入可编辑工作流Daily · 4月17日
  • GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限Daily · 4月16日
  • Adobe Firefly 创意工具的彩色视觉画面Adobe 让 Firefly 助手跨应用执行,创意 AI 进入工作流编排Daily · 4月15日
  • OpenAI 标志叠在蓝色二进制数字背景前OpenAI 收购 Hiro,通用助手开始进入高信任个人财务场景Daily · 4月14日
  • Guillermo Rauch 在 HumanX 大会舞台上发言Vercel 称三成托管应用由 Agent 创建,部署量开始接受收入检验Daily · 4月13日
  • 电信领域多语言意图与流程对齐电信领域多语言意图与流程对齐Daily · 4月10日
  • Meta AI 标志置于蓝紫色彩背景中央Meta 发布 Muse Spark,模型重启转向产品与多智能体协作Daily · 4月9日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS