DeepSWE 更新:GPT-5.5 以 70% 绝对领先,Claude Opus 4.8 以 58% 居次
Datacurve 于 6 月 7 日更新 DeepSWE 排行榜——一个从头编写、113 任务、91 仓库、5 语言的软件工程基准。GPT-5.5(xhigh)以 70%±3% 居首,较第二名 Claude Opus 4.8(max)领先 12 个百分点(58%±2%),GPT-5.4(xhigh)以 56%±2% 紧随其后。
关键效率对比:
- GPT-5.5:每任务平均成本 $6.61,耗时 21 分钟,输出 47K token。
- Claude Opus 4.8:每任务平均成本 $12.58(1.9×),耗时 43 分钟(2×),输出 136K token(2.9×)。
- Claude Opus 4.7:54%±5%,成本 $18.19/任务,输出 103K token。
Sonnet 4.6(32%)、Gemini 3.5 Flash(28%)、Opus 4.6(28%)构成第二梯队。DeepSeek V4 Pro 仅得 8%,Gemini 3 Flash 垫底 5%,显示该基准对模型的区分度远高于现有编码榜单——SWE-Bench Verified 上前五名差距已收缩至约 10 个百分点且置信区间高度重叠,而 DeepSWE 将同一批前沿模型拉开至 65 个百分点的跨度。
DeepSWE 的核心设计:任务从头编写(不基于已有 commit/PR),验证器手写测试软件行为而非实现细节,提示长度约为 SWE-Bench Pro 的一半但解决方案需 5.5× 更多代码。
来源:Datacurve《DeepSWE》(更新于 2026-06-07)https://deepswe.datacurve.ai
RuntimeWire 精准度对比:DeepSeek V4 Pro 38 vs GPT-5.5 Pro 33
6 月 8 日,RuntimeWire 发布了一项头对头精准度编码评测:DeepSeek V4 Pro 以 38.0 分击败 GPT-5.5 Pro 的 33.0 分。评测聚焦于指令遵循、schema 匹配和边界情况处理。该文登上了 Hacker News 首页(395 分),引发对评测方法论的激烈讨论——多位评论者指出该测试仅包含四个非标准化实验,样本量不足以得出广义能力结论。
FutureSearch 的分析进一步指出,OpenAI 已有 90% 概率在企业实际采购的编码基准上超越 DeepSeek V4 Pro,且 GPT-5.5 本身已在多数编码基准上领先。DeepSeek V4 Pro 的价格优势(约为 OpenAI 的 1/5)是这轮讨论的核心驱动力,而非方法论上的压倒性证据。
来源:RuntimeWire《DeepSeek V4 Pro beats GPT-5.5 Pro on precision》(2026-06-08)https://runtimewire.com/article/deepseek-v4-pro-beats-gpt-5-5-pro-on-precision ;FutureSearch《DeepSeek V4 Pro Won't Move the Market》https://futuresearch.ai/blog/deepseek-v4-pro-wont-move-the-market