AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

编码 Agent 研究「缺了人」:13 位研究者联署呼吁转向人机协作

今天 · 共 3,069 字

Agent模型
Humans are Missing from AI Coding Agent Research (arXiv:2608.12355)

编码 Agent 的评测分数还在涨,但一篇由该领域最核心的一批研究者联署的立场论文提醒:这些分数可能正在衡量错误的东西。论文《Humans are Missing from AI Coding Agent Research》有 13 位作者,其中包括 Graham Neubig、Daniel Fried、Karthik Narasimhan、Diyi Yang、Lingming Zhang 等在编码与 Agent 研究中有重要影响的学者。它的核心论断是:过去几年研究几乎只沿一条轴前进——「自主解题率」,用 SWE-bench 这类基准的通过率衡量;当 Agent 越来越能独立完成任务时,真实使用的瓶颈已从「能不能做对」转移到「人能不能理解、信任、驾驭它」。

论文的实证附录给出反直觉的数字:在 SWE-bench Verified 上,即便被判「已解决」的补丁也普遍比参考解臃肿,且这种臃肿与解题能力几乎不相关;超过一半的「已解决」补丁与参考解存在功能偏差——测试通过,不代表补丁接近人真正想要的。

分数在涨,补丁却越来越难查

论文做了一个此前很少做的测量:不看「是否通过测试」,而看「通过的补丁长什么样」。作者对 SWE-bench Verified 上「已解决」的补丁计算「臃肿比」——提交补丁相对参考补丁(gold patch)的字符长度比值。

结果:所有模型的平均臃肿比都显著高于 1,且与解题能力几乎不相关——分数更高的模型并不产出更简洁的补丁;臃肿比与臃肿补丁的占比还随模型发布日期呈上升趋势。所有模型「臃肿补丁」(比值超过 1.5)的占比都超过 15%。用 GPT-5 mini 与 Claude Haiku 4.5 做裁判标注来源后,最大头是「冗长实现」(约 60%,如不必要的中间变量赋值),其次是「范围蔓延」(50%–65%,改了任务没要求的东西)与「过度防御性代码」(20%–30%)。

第二个测量更尖锐:功能偏差。SWE-bench 以测试是否全通过判定「解决」,但测试并不覆盖全部行为细节。作者让两个裁判模型比对「问题陈述、提交补丁、参考补丁」,只把两者都判定存在差异的算作功能偏差。结果:对所有模型,超过 50% 的「已解决」补丁存在功能偏差;Claude Haiku 4.5 判定 66%、GPT-5 mini 判定 62%、两者一致 57%;且这种偏差在越新的模型里越普遍。

两组数字指向同一结论:以「测试通过」为核心的正确性口径,会系统性放行「能跑、但难审查、且偏离意图」的补丁。当补丁越来越长、范围越来越大,人类审查者要付出的验证成本反而上升——这正是论文说的「研究在优化一个边际收益递减的方向」。

四个维度:把「人机协作」变成可测的量

论文没有停在批评,而是把人机协作拆成四个可形式化的维度,各给出可计算的度量:

  • 任务对齐(task alignment):人与 Agent 是否建立并维持共同的任务理解,度量用户意图规范与 Agent 推断规范之间的相似度。论文指出当前基准用 pass@k 把沟通质量压成单个比特,完全没捕捉「误解发生在哪一步」。
  • 可控性(steerability):Agent 能否在执行中暴露并对人的控制信号作出响应。作者反对「自主性是一个全局开关」的假设——真实用户时而放手「vibe coding」、时而又要精确到局部改动;Agent 需要识别有意义的决策点并把选择交给人。
  • 可验证(verification):用户能否判断输出是否满足任务要求。论文特别指出单测作为默认验证机制的局限:当代码与测试都由 AI 生成,测试不再构成独立证据,验证负担只是从「查代码」平移成「查代码 + 查测试」。
  • 适应性(adaptability):Agent 能否跨会话积累经验、保留用户偏好。作者批评今天 Agent 的「记忆」「技能」大多只是索引化的 Markdown 文件而非持续学习;「开发者要求用 logging 而非 print」这类偏好能否保留到下周,仍无系统评估。

四维度覆盖人机任务循环的四个阶段:理解意图 → 受控执行 → 暴露输出供判断 → 跨会话改进。安全、主动性、编排等更高层属性,作者视作这四个维度的组合或延伸,而非独立的基础能力。

为什么是现在:从「刷榜」到「真实使用」

论文的论证不只在「该换方向」,更在「现实里方向已经换了,研究还没跟上」。

它援引 Stack Overflow 2025 年开发者调查:84% 的开发者已在使用 AI 编码工具,其中近一半不信任输出,三分之二报告「半成品方案带来更重的调试负担」。真实使用数据与静态基准的分歧已经可见:Copilot Arena 在 IDE 里收集的日常偏好信号,与静态基准的模型排名显著偏离;Cursor 的 Tab RL 从每天 4 亿多次「接受/拒绝」决策里学到「何时建议」与「建议什么」同样重要——这些洞察在 pass@k 里完全不可见。

「方向正在成型」的另一个信号来自社区本身。论文 7 月 4 日首发、8 月 15 日交叉收录到 cs.AI;同期 ICML 2026 的 DL4C 工作坊(Deep Learning for Code)已把「human-centered coding agents」设为主题,其征稿方向列出的任务对齐、可控性、适应性等,与论文的四维度高度重合。论文致谢也提到,其论证在 DL4C 工作坊的讨论中成形。

论文如何回应「AI 将取代编码」

立场论文最容易被反驳的一点是:如果 AI 很快能写出所有代码——论文援引 Anthropic CEO Dario Amodei 在 2025 年 3 月「AI 将写出 90% 的代码」的说法——研究人机协作是否是个很快过时的课题?论文的回应是:无论预言是否成真,人都不会退出循环。当 Agent 承担越来越复杂的任务,需要做的「决定」反而更多,其中很多是个性化的、组织特定的、只有特定的人掌握的信息;人的努力只是从「实现」上移到「规范与评估」。

对「人类评测太贵、无法规模化」,论文指出 NLP 领域已用奖励模型、LM-as-judge 等可扩展代理解决过类似问题,代码领域也有现成的可计算指标(圈复杂度、可维护性指数、可读性)作代理,更有 tau-bench 这类用户模拟器与 Copilot Arena 这类「通过真实使用收集偏好」的路径。对「能力优先、人机交互只是产品问题」,论文用 GPT-3 到 ChatGPT 的跨越反驳:把人类偏好纳入训练目标本身,才把「研究产物」变成「让人愿意用的产品」。作者明确这不是反 scaling 的立场,而是「scaling 的方向本身值得审视」——继续只优化自主解题,得到的只会是「更自主的解题器」,而非「更好的协作者」。

边界:这是一篇立场论文

这篇文章的定位要讲清。它没有提出新基准,也没有新的训练实验;附录里的补丁臃肿与功能偏差是作者在 SWE-bench Verified 语境下用两个裁判模型做的自测,未经独立评审。四个维度的度量虽有形式化定义,距离工业界大规模落地仍有距离——论文也承认,这些度量都需要「从人类行为分布采样」,而当前开源管线无法大规模提供。

作者在文末坦承一个更深层的担忧:他们提出的框架既可能导向「更好的协作」,也可能被读作「为最终取代人类而收集人类信号的监听装置」。论文的态度是「我们不知道」——它的论证范围更窄:在研究还没搞清「有效协作长什么样」之前,过早把「完全自主」当作唯一优化目标是有风险的。

因此这篇文章的价值不在给答案,而在说清一个正在发生的错位:编码 Agent 的能力在单一维度上狂飙,真实使用的瓶颈已经转移。对 Agent 构建者与评测设计者,可操作的问题随之而来——报告里「模型自评」与「独立验证」是否分开计数、验证是否独立于生成、跨会话偏好能否保留。这正是四维度试图把它从「产品直觉」变成「可测指标」的地方。

来源

  1. Position: Humans are Missing from AI Coding Agent Research · arXiv
  2. CFP: The 5th DL4C Workshop — Towards Human-Centered Coding Agents · Deep Learning for Code (DL4C)

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Google 官方性能与成本对比图,展示 Gemini 3.7 Flash 相对前代与竞品的位置

    Gemini 3.7 Flash 三周即迭代:首发价减半,编码与文档工作负载领先

    算法 · 2026-08-15

  • 论文图 1:AutoResearch 轨迹的生成与执行成本随规模非对称增长——生成通过批处理共享算力,执行则每个方案独占一个沙箱与真实机时,使执行成为传统 RL 的瓶颈;WMRL 用世界模型移除该瓶颈

    用世界模型替代环境执行,Agent RL 提速 3–4 倍且性能不降反升

    算法 · 2026-08-15

  • Grok Bot launch announcement hero image showing the product branding

    Grok Bot 给 AI Agent 配了一台永不离线的云电脑

    算法 · 2026-08-12

  • NVIDIA Nemotron 3.5 Lightning agentic AI 架构示意图

    Nemotron 3.5 Lightning 发布:路由库 Switchyard 才是 NVIDIA 的真正赌注

    算法 · 2026-08-12

  • Andrew Bird 手持手机,他的 AI Agent 在预订健身房课程时发现了系统漏洞

    从沙箱到健身房:消费者 AI Agent 的安全边界早已失守

    算法 · 2026-08-10

  • Motif Technologies 标志

    Motif-3 正式发布:韩国 30 人团队用政府算力造出 MIT 许可的 314B MoE,Agent 基准领跑四强

    算法 · 2026-08-10

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS