DeepSWE:全新长周期软件工程基准——GPT-5.5 以 70% 领跑,DeepSeek V4 Pro 仅 8%
DataCurve 发布 DeepSWE,一个从零编写的长周期软件工程基准,覆盖 91 个仓库、5 种语言、113 个任务。与 SWE-bench Pro 相比,提示长度约减半但解决方案代码量 5.5 倍、输出 token 约 2 倍。所有模型统一使用 mini-swe-agent harness 运行,截至 2026 年 5 月 30 日的榜单显示:GPT-5.5(xhigh)70% ± 4%,Claude Opus 4.8(max)58% ± 5%,GPT-5.4(xhigh)56% ± 5%,Claude Opus 4.7(max)54% ± 5%,Claude Sonnet 4.6(high)32% ± 4%,Gemini 3.5 Flash(medium)28% ± 4%,DeepSeek V4 Pro 仅 8% ± 2%。榜单末端的 DeepSeek V4 Pro 与 Gemini 3 Flash(5% ± 2%)结果引发社区讨论——一些用户在 OpenCode 等工具中主观体验与此排名差异明显,提示 harness 选择对 SWE 类基准的敏感性。
来源:DeepSWE Leaderboard(2026-05-30 更新)https://deepswe.datacurve.ai/
SCDBench:600 合约智能合约反编译基准——最佳模型仅完美反编译 42/600
SCDBench 基于 600 个真实 Solidity 合约,通过四阶段累积评估(格式完整性 → 可编译性 → ABI 恢复 → 差分重放的语义一致性)评测 LLM 反编译器。在零样本设定下评估 Claude Opus 4.7、GPT-5.3-Codex 和 GLM-5:前沿模型可生成结构化且可编译的 Solidity,但语义一致性远未解决——最佳模型仅完美反编译 42/600 合约。引入同模型编译修复可显著提升性能,额外成本适中。
来源:arXiv《SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers》(2026-05-29)https://arxiv.org/abs/2605.29059
BenchTrace:Agent 自我进化能力评测——FAR 指标揭示反思瓶颈
BenchTrace 基于 1,821 个标注 episode 构建,包含反思评估(通过定向 QA 探测失败识别)和进化评估(在受控自我进化模拟中测试失败经验是否转化为规避行为),并提出失败规避率(FAR)指标。Qwen3-32B 和 GPT-4.1 的反思评估端到端通过率均低于 30%,诊断是主要瓶颈。进化评估显示:自我进化方法普遍提升 FAR,但 Agent 随噪声 episode 累积会遗忘早期教训,且反思无法跨任务上下文泛化,导致负迁移。仅有完全正确的反思才与更高的 FAR 强相关。
来源:arXiv《BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents》(2026-05-29)https://arxiv.org/abs/2605.29225
RedundancyBench:Agent 轨迹冗余步骤检测——最佳方法仅 24.88%
现有 Agent 评测聚焦任务成功率,忽视执行效率。RedundancyBench 对轨迹中每一步标注其对任务完成的贡献,提出冗余步骤检测这一新研究方向。三种代表性方法中,最佳仅达 24.88% 得分,部分方法劣于随机猜测,揭示该任务的极高难度。
来源:arXiv《Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories》(2026-05-29)https://arxiv.org/abs/2605.29893
CrystalXRD-Bench:VLM 科学图表定量推理——最佳 Jaccard 仅 0.5888
CrystalXRD-Bench 包含 250 个粉末 XRD 图谱样本,任务为恢复最高强度峰的完整 Miller 指数(HKL)集合。七款 VLM 中,GPT-5.4 取得最佳 Jaccard 0.5888、精确匹配率 37.6%,六款模型 Jaccard 低于 0.50。双峰案例尤为脆弱,高召回模型通过过度预测 HKL 来提升覆盖率,CIF 文本的提供并未弥合晶体学计算差距。
来源:arXiv《CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing》(2026-05-29)https://arxiv.org/abs/2605.29446
Abliterlitics:13 个 Gemma 4 E2B 消融变体横评——"能力保留"声明多数不成立
社区独立评测对比了 13 个 Gemma 4 E2B 的 abliterated 变体,在单张 RTX 5090 上运行 44 GPU 小时,覆盖权重取证、KL 散度、HarmBench 安全性和 8 项 lm-eval 基准。核心发现:coder3101 变体以 96% ASR 实现能力完全保留,GSM8K 甚至超越基础模型(84.8% vs 83.5%);treadon 达到 100% ASR 但 GSM8K 下降 2.9 分。多数模型卡上的"能力保留"声明经验证不成立——duoneural 声称 KL 散度约 0.001,实测 0.187(187 倍差距);wwtcyberlab 声称"101% 质量保留",实测 LAMBADA 困惑度为基线的 5.69 倍。
来源:Reddit r/LocalLLaMA(2026-05-31)https://www.reddit.com/r/LocalLLaMA/comments/1tsvs3j/ | 完整报告:https://huggingface.co/DreamFast/Gemma4-e2b-abliterlitics
ProjectionBench:渐进式信息揭示下的科学假设生成评测——GPT-5.4 在最小上下文中保持 0.7 F1
ProjectionBench 从近期论文中提取 45 篇(涵盖生物活性材料、机械材料和纳米材料),模型最初仅接收主题和研究问题,技术细节逐步揭示。每个阶段评估模型生成的假设与原论文结论的语义相似度。GPT-5.4 和 Gemini 3.1 Pro 预览版超越前代,GPT-5.4 在最小上下文下仍保持 0.7 F1 与 ground truth 对齐。
来源:arXiv《ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure》(2026-05-29)https://arxiv.org/abs/2605.30284