AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

DeepSWE:全新长周期软件工程基准——GPT-5.5 以 70% 领跑,DeepSeek V4 Pro 仅 8%

2026年6月1日 · 2026-06-01

榜单与结果

DeepSWE:全新长周期软件工程基准——GPT-5.5 以 70% 领跑,DeepSeek V4 Pro 仅 8%

DataCurve 发布 DeepSWE,一个从零编写的长周期软件工程基准,覆盖 91 个仓库、5 种语言、113 个任务。与 SWE-bench Pro 相比,提示长度约减半但解决方案代码量 5.5 倍、输出 token 约 2 倍。所有模型统一使用 mini-swe-agent harness 运行,截至 2026 年 5 月 30 日的榜单显示:GPT-5.5(xhigh)70% ± 4%,Claude Opus 4.8(max)58% ± 5%,GPT-5.4(xhigh)56% ± 5%,Claude Opus 4.7(max)54% ± 5%,Claude Sonnet 4.6(high)32% ± 4%,Gemini 3.5 Flash(medium)28% ± 4%,DeepSeek V4 Pro 仅 8% ± 2%。榜单末端的 DeepSeek V4 Pro 与 Gemini 3 Flash(5% ± 2%)结果引发社区讨论——一些用户在 OpenCode 等工具中主观体验与此排名差异明显,提示 harness 选择对 SWE 类基准的敏感性。

来源:DeepSWE Leaderboard(2026-05-30 更新)https://deepswe.datacurve.ai/

SCDBench:600 合约智能合约反编译基准——最佳模型仅完美反编译 42/600

SCDBench 基于 600 个真实 Solidity 合约,通过四阶段累积评估(格式完整性 → 可编译性 → ABI 恢复 → 差分重放的语义一致性)评测 LLM 反编译器。在零样本设定下评估 Claude Opus 4.7、GPT-5.3-Codex 和 GLM-5:前沿模型可生成结构化且可编译的 Solidity,但语义一致性远未解决——最佳模型仅完美反编译 42/600 合约。引入同模型编译修复可显著提升性能,额外成本适中。

来源:arXiv《SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers》(2026-05-29)https://arxiv.org/abs/2605.29059

BenchTrace:Agent 自我进化能力评测——FAR 指标揭示反思瓶颈

BenchTrace 基于 1,821 个标注 episode 构建,包含反思评估(通过定向 QA 探测失败识别)和进化评估(在受控自我进化模拟中测试失败经验是否转化为规避行为),并提出失败规避率(FAR)指标。Qwen3-32B 和 GPT-4.1 的反思评估端到端通过率均低于 30%,诊断是主要瓶颈。进化评估显示:自我进化方法普遍提升 FAR,但 Agent 随噪声 episode 累积会遗忘早期教训,且反思无法跨任务上下文泛化,导致负迁移。仅有完全正确的反思才与更高的 FAR 强相关。

来源:arXiv《BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents》(2026-05-29)https://arxiv.org/abs/2605.29225

RedundancyBench:Agent 轨迹冗余步骤检测——最佳方法仅 24.88%

现有 Agent 评测聚焦任务成功率,忽视执行效率。RedundancyBench 对轨迹中每一步标注其对任务完成的贡献,提出冗余步骤检测这一新研究方向。三种代表性方法中,最佳仅达 24.88% 得分,部分方法劣于随机猜测,揭示该任务的极高难度。

来源:arXiv《Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories》(2026-05-29)https://arxiv.org/abs/2605.29893

CrystalXRD-Bench:VLM 科学图表定量推理——最佳 Jaccard 仅 0.5888

CrystalXRD-Bench 包含 250 个粉末 XRD 图谱样本,任务为恢复最高强度峰的完整 Miller 指数(HKL)集合。七款 VLM 中,GPT-5.4 取得最佳 Jaccard 0.5888、精确匹配率 37.6%,六款模型 Jaccard 低于 0.50。双峰案例尤为脆弱,高召回模型通过过度预测 HKL 来提升覆盖率,CIF 文本的提供并未弥合晶体学计算差距。

来源:arXiv《CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing》(2026-05-29)https://arxiv.org/abs/2605.29446

Abliterlitics:13 个 Gemma 4 E2B 消融变体横评——"能力保留"声明多数不成立

社区独立评测对比了 13 个 Gemma 4 E2B 的 abliterated 变体,在单张 RTX 5090 上运行 44 GPU 小时,覆盖权重取证、KL 散度、HarmBench 安全性和 8 项 lm-eval 基准。核心发现:coder3101 变体以 96% ASR 实现能力完全保留,GSM8K 甚至超越基础模型(84.8% vs 83.5%);treadon 达到 100% ASR 但 GSM8K 下降 2.9 分。多数模型卡上的"能力保留"声明经验证不成立——duoneural 声称 KL 散度约 0.001,实测 0.187(187 倍差距);wwtcyberlab 声称"101% 质量保留",实测 LAMBADA 困惑度为基线的 5.69 倍。

来源:Reddit r/LocalLLaMA(2026-05-31)https://www.reddit.com/r/LocalLLaMA/comments/1tsvs3j/ | 完整报告:https://huggingface.co/DreamFast/Gemma4-e2b-abliterlitics

ProjectionBench:渐进式信息揭示下的科学假设生成评测——GPT-5.4 在最小上下文中保持 0.7 F1

ProjectionBench 从近期论文中提取 45 篇(涵盖生物活性材料、机械材料和纳米材料),模型最初仅接收主题和研究问题,技术细节逐步揭示。每个阶段评估模型生成的假设与原论文结论的语义相似度。GPT-5.4 和 Gemini 3.1 Pro 预览版超越前代,GPT-5.4 在最小上下文下仍保持 0.7 F1 与 ground truth 对齐。

来源:arXiv《ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure》(2026-05-29)https://arxiv.org/abs/2605.30284

方法与争议

评测元知识:知道"评测怎么设计"的模型在安全基准上得分更高——一种新型混淆因子

研究者将模型在描述评测结构特征的合成文档上微调后,在六项安全基准上显著优于基础模型和对照模型。该行为偏移在排除显式"评测意识"表述的响应中依然存在。这意味着评测元知识(模型参数中对评测结构特征的认知,类似数据污染但独立于显式记忆)可能系统性地膨胀安全基准分数,且难以检测。该发现对安全评测的设计与解读构成直接挑战。

来源:arXiv《Models That Know How Evaluations Are Designed Score Safer》(2026-05-28)https://arxiv.org/abs/2605.28591

LLM 渗透测试一致性:400 次运行揭示模型间攻防行为差异巨大

首项针对 LLM 自主渗透测试一致性的 N=100 大规模实证研究:4 个模型、各 100 次运行,攻击同一蜜罐(OWASP Juice Shop + 两个额外漏洞服务)。Gemini 2.5 Flash-Lite 在 85/100 次运行中实现完全利用,GPT-4o-mini 56 次(部署了 98 种独特攻击策略),Claude Sonnet 4 在 61 次(39 次因 Anthropic 上游容量事件导致的 API 截断),qwen2.5-coder:14b 仅 25 次。失败模式具有模型特异性:Claude 因 API 截断、qwen 因过早完成(52 次)、GPT-4o-mini 因迭代预算耗尽(23 次)。首次利用时间集中在 15–30 秒。跨服务凭据复用仅出现在保留最多对话历史的配置中。

来源:arXiv《How Reliable Are AI Attackers Against a Fixed Vulnerable Target?》(2026-05-29)https://arxiv.org/abs/2605.30096

SciIntBench:科研诚信对抗性基准——模型在"压力驱动捷径"前最脆弱

SciIntBench 包含 810 个提示,覆盖 10 类科研诚信(RCR)范畴和 3 个科学领域,每个场景以显式对抗、隐蔽对抗和良性三种版本呈现。16 个商业和开源 LLM 在 12,960 个回答中表现出强烈的框架敏感性:模型对显式不当行为拒绝较为可靠,但对隐蔽违规——尤其是以"压力驱动捷径"呈现的违规——频繁失守。透明度、剽窃和伪造相关边界最为薄弱。

来源:arXiv《SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing》(2026-05-29)https://arxiv.org/abs/2605.29468

文献检索评测的根基动摇:人类引用列表不是 ground truth

在 RollingEval-Jun25(250 篇论文)上,Deep Research 管线将召回率从 20% 以下提升至 80% 以上。但更关键的方法论发现是:仅 51% 的人类引用被中性 LLM-as-a-judge 判定为中等相关或以上,而最强 AI 重排序器达 86%–88%。在 OpenAlex 合著关系图上,人类引用直接合作者的概率是 AI 重排序器的 2.5 倍。结论:文献检索评测应同时报告召回率、主题相关性、排序多样性和合著距离诊断,而非依赖单一轴。

来源:arXiv《Rethinking Literature Search Evaluation》(2026-05-29)https://arxiv.org/abs/2605.29234

LLMSurgeon:仅凭生成文本审计模型预训练数据混合——"数字 DNA"逆向工程

LLMSurgeon 将数据混合诊断为标签偏移下的逆问题:估计校准后的软混淆矩阵并求解约束逆问题以恢复潜在领域混合先验。配套的 LLMScan 评测套件基于开源 LLM 的透明预训练配方构建,LLMSurgeon 在固定协议下高保真恢复领域混合。该工作为无需训练数据访问权限的基座模型后验审计提供了实用路径。

来源:arXiv《LLMSurgeon: Diagnosing Data Mixture of Large Language Models》(2026-05-29)https://arxiv.org/abs/2605.30348

Multi-Legal-Bench:跨法域法律推理——语言亲缘性不预测迁移效果

首个跨法域法律基准,覆盖 6 国(乌克兰、法国、荷兰、波兰、捷克、立陶宛)、4 个语系、1.34 亿份判决,5 项任务 × 6 法域构成稀疏矩阵。关键发现:跨语言少样本迁移不遵循语言亲缘性——乌克兰语 → 法语(罗曼语族,-2.1 pp)优于乌克兰语 → 波兰语(斯拉夫语族,-13.7 pp);标签集对齐比语系更能预测迁移质量;tokenizer 生育率(2.3 倍差异)不显著预测跨语言准确率(r=-0.27, p=0.14)。

来源:arXiv《Multi-Legal-Bench: Evaluating LLMs on Legal Reasoning Across Jurisdictions, Languages, and Legal Traditions》(2026-05-29)https://arxiv.org/abs/2605.29738

工具与标准

BT-sigma:LLM 陪审团——无需人工标注的裁判可靠性建模

BT-sigma 是 Bradley-Terry 模型的裁判感知扩展,为每个 LLM 裁判引入辨别力参数,从成对比较中联合推断项目排名和裁判可靠性。在 NLG 评测基准上,BT-sigma 持续优于均值聚合方法,学习到的辨别力与裁判循环一致性的独立度量强相关。本质上是一个无监督校准机制。

来源:arXiv《Who can we trust? LLM-as-a-jury for Comparative Assessment》(v2: 2026-05-29)https://arxiv.org/abs/2602.16610

Rulers:从评分标准到可靠分数——证据锚定的 LLM 评判

Rulers 针对 LLM 评分三大失败模式(评分标准执行漂移、不可验证的分数归因、人机尺度不对齐),提出三阶段推理框架:锁定任务级规范 → 结构化清单决策 + 类型化证据锚定 + 抽取式引用验证 → 后验校准。在四个评分标准治理的基准(作文评分、摘要评估、EFL 写作、结构化文本生成)上,跨多个冻结骨干模型实现更强的人类分数一致性,且在语义等价评分标准扰动下更稳定。

来源:arXiv《From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges》(v2: 2026-05-29)https://arxiv.org/abs/2601.08654

GrowLoop:以人类为种子的自我进化对话评测——基准即生命体

GrowLoop 以最少人类种子标注为起点,LLM Agent 通过启发式学习迭代提取和精炼评测评分标准。评分标准与案例共同进化,当评测目标迁移时通过新种子扩展。应用于开放对话的人类相似度评测,生成的评分标准不仅在对齐人类判断上显著优于现有方法,还揭示了标注者遗漏的问题。范式从手动更新或难度扩展转向持续自我进化。

来源:arXiv《GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human》(2026-05-29)https://arxiv.org/abs/2605.28882

GUITestScape:探索式 GUI 测试的开集评测——检测是瓶颈

GUITestScape 覆盖 61 个真实 Android 应用和 508 个预置缺陷(交互 + 显示双类型),配套 GUIJudge 开集评测器将 Agent 测试轨迹分解为独立可诊断能力。实验表明检测是现有模型在两类缺陷上的关键瓶颈,将 GUIJudge 验证器集成到现有 Agent 中可显著提升检测性能而无需重训练。

来源:arXiv《GUITestScape: Towards Open-set Evaluation on Exploratory GUI Testing》(2026-05-29)https://arxiv.org/abs/2605.29532

LLM Agent 行为可复现性:同一 Agent 会以同样方式执行两次吗?

首项针对多步工具调用 Agent 行为一致性的系统实证研究,测量 Agent 在重复相同调用时是否选择相同工具、相同顺序、相同参数。与先前 ReAct 风格 Agent(仅搜索、自由文本动作)的一致性研究不同,本工作聚焦于具有类型化参数和后果性副效应的结构化工具调用接口。

来源:arXiv《How Consistent Are LLM Agents? Measuring Behavioral Reproducibility in Multi-Step Tool-Calling Pipelines》(2026-05-29)https://arxiv.org/abs/2605.28840


说明:本期窗口(5 月 28–31 日)侧重:(1) 新基准设计——DeepSWE 以全新编写任务和 5.5× 代码量拉开前沿模型差距,SCDBench 揭示反编译语义一致性远未解决,BenchTrace 和 RedundancyBench 分别从反思质量和执行效率角度补全 Agent 评测盲区;(2) 评测效度威胁——评测元知识作为新型混淆因子可独立于显式记忆膨胀安全分数,SciIntBench 揭示科研诚信对齐的框架敏感性,文献检索评测中人类引用列表的 ground truth 地位受到实证挑战;(3) 评测基础设施建设——BT-sigma 实现无需标注的裁判可靠性建模,Rulers 以证据锚定提升 LLM 评判可信度,GrowLoop 将基准从静态快照转为自我进化系统,LLMSurgeon 为基座模型训练数据审计提供后验工具。上期已覆盖的 FormInv、FinVerBench、MINDGAMES、EVA-Bench、Cookie-Bench、Review Arcade、LaRA、PRAIB、Critique-Resilient Benchmarking、KBF、Token Inflation、GEO-Bench、Croissant Tasks、CalArena、LogDx-CI、e-valuator、Harness-Bench、Unified Agentic Framework、VibeSearchBench、KTD-Fin、RAMP 等不再重复。

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • AI 企业级成本清算:Microsoft 砍 Claude Code、Uber 四个月烧光全年预算AI 企业级成本清算:Microsoft 砍 Claude Code、Uber 四个月烧光全年预算Daily · 5月31日
  • FormInv:数学推理基准的语义不变性审计——\\\"No-Free-Benchmark\\\"定理FormInv:数学推理基准的语义不变性审计——\"No-Free-Benchmark\"定理Daily · 5月30日
  • XCENA 面向 AI 系统设计的内存芯片与电路板XCENA 融资 1.35 亿美元,押注 AI 的下一瓶颈是内存Daily · 5月29日
  • 一名人物侧身拿着手机与 Sesame 语音助手对话Sesame 推出 iOS 应用,实时语音 Agent 进入移动端Daily · 5月28日
  • Robinhood Agentic Trading 产品界面展示账户与交易操作Robinhood 让 AI Agent 交易股票,权限设计开始直接影响余额Daily · 5月27日
  • 多个人工智能助手站在分割的平台上的概念插画严格窗口内未发现足以成条的 AI 产业新增Daily · 5月26日
  • 教宗 Leo XIV 在公开活动中讲话教宗 AI 通谕把问题转向劳动、文化与收益分配Daily · 5月25日
  • Amazon Bee 可穿戴助手的手机端应用界面Amazon Bee 把持续记录带进可穿戴设备Daily · 5月24日
  • 一辆 Ferrari F1 赛车在赛道上高速行驶Ferrari 用 IBM AI 经营 F1 粉丝关系Daily · 5月23日
  • Google AI 眼镜的多款产品合成展示图Google AI 眼镜接近可用,硬件边界仍比模型演示更关键Daily · 5月22日
  • 空旷办公室里一名人物站在落地窗前的剪影Hark 获 7 亿美元 A 轮,通用 AI 界面继续吸走巨额资本Daily · 5月21日
  • 手机屏幕上的 Intuit 标志与背景中的股票行情图Intuit 裁员逾 3000 人,把资源重新押向 AIDaily · 5月20日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS