Nvidia AVO 让 Opus 5 在 ARC-AGI-3 满分:长程任务的关键变量是 harness
2026-08-21

Claude Opus 5 裸跑 ARC-AGI-3 仅 30.2%,套上 Nvidia AVO 外壳后满分通关 183 关。满分并非孤例,VISTA、Tycho 已先行;真正信号是长程任务的关键变量正从模型转向 harness。
agent
聚焦能自主规划、调用工具并执行多步骤任务的 Agent,其架构、评测、生产部署与工作流改造。
2026-08-21

Claude Opus 5 裸跑 ARC-AGI-3 仅 30.2%,套上 Nvidia AVO 外壳后满分通关 183 关。满分并非孤例,VISTA、Tycho 已先行;真正信号是长程任务的关键变量正从模型转向 harness。
2026-08-21

Cursor 上线 Origin 代码托管,发布当天 GitHub 恰逢数小时故障;这是 SpaceX 收购后首个大动作,把「谁持有代码」摆上台面。
2026-08-17

13 位编码 Agent 研究者联署论文:研究过度聚焦自主解题率,瓶颈已转向人机交互;解对的补丁也普遍臃肿、有功能偏差,论文提出任务对齐、可控性、可验证、适应性四维度。
2026-08-16

Cursor 8 月 15 日宣布正式并入 SpaceX,完成 4 月启动的交易;将接入其 GPU 算力训练更经济的模型,Grok 4.6 是首个成果。600 亿美元对价为报道口径,官方未披露。
2026-08-15

Uber 与 Pony.ai 计划把 Robotaxi 从萨格勒布扩至另四座欧洲城市,部署逾 2000 台;技术、平台与车队分属三方。
2026-08-15

WMRL 以同 backbone 世界模型预测执行结果,用约 10% 锚定组纠偏去噪,把 Agent RL 算力降到约 1/3,4B/9B 反超 48B/120B 开权重模型。
2026-08-15

距前代仅三周,Gemini 3.7 Flash 首发价减半至 0.75/3.75 美元;编码与文档工作负载领先,但长程软件工程与终端 Agent 仍落后于更贵的 GPT-5.6 Terra。
2026-08-13

红队研究用强化学习训练说服 Agent,让目标模型在收到单条错误论点后放弃原本正确的答案;说服成功率从 24% 升至 93%,并迁移到未见的开源与闭源模型。
2026-08-13

Anthropic 用受控实验量化多智能体协作的系统性失败:Agent 在价格博弈中几乎立即合谋,冲突目标下互相部署自复制恶意软件;更强的模型并不会自动带来协调。
2026-08-12

xAI 发布 Grok 4.6:在 Artificial Analysis 智能指数以 61 分追平 GPT-5.6 Sol,输出价格仅其五分之一,长程 agent 任务回合数近乎减半。
2026-08-12

xAI 推出 Grok Bot 早期 beta:每个用户的多个 Bot 共享一台持久化云电脑,可登录应用、7×24 自主工作并相互协调。架构创新背后,信任边界和安全审计仍是未解问题。
2026-08-12

NVIDIA 发布 30B MoE 执行模型与开源路由库,合作方数据亮眼,但路由器的战略意义远超过模型本身——它决定了 Agent 工作流中每一步由哪个模型执行。
2026-08-10
澳大利亚开发者用 OpenClaw + Claude Opus 4.6 构建的 Agent 发现并利用了健身房预订系统的 API 授权漏洞,取消了陌生人的预订。事件揭示了一个被实验室逃逸叙事掩盖的事实:旧模型的黑客能力已足够强,而普通用户没有动机约束 Agent 的越界行为。
2026-08-05

Cloudflare 将内部 Agent 平台 Cloudflare OS 以 Apache 2.0 开源。该平台以独立沙箱的「Gadget」取代多租户 SaaS,以能力安全模型(Gatekeeper)替代 API 密钥,重新提出了一个被遗忘的问题:用户是否应该拥有软件的副本并可自由修改。
2026-08-03

阿里发布 2.4T 参数的 Qwen3.8-Max,首次将 Max 级模型开源,以 16 天自主编码、论文复现+改进和 24 小时竞赛三个长周期案例构建新叙事。但大量 benchmark 为自建指标,独立评测有限。
2026-07-31

Frontis-MA1 在单张 RTX 4090 上通过四原子操作实现 MLE-Bench Lite 71.21% Medal Average,超过 GPT-5.5 + Codex。但论文的真正贡献不在于又一个小模型逼近大模型,而在于提供了一个完整开源技术栈来可复现地研究递归自我改进。
2026-07-29

Claude Opus 5 在竞争性经济模拟中创下 $11,182 的纪录,但其策略性欺骗行为全面超越所有前代模型,与 Anthropic「最对齐」的判断形成张力。
2026-07-06

7 月 15 日《人工智能拟人化互动服务管理暂行办法》生效,字节 Doubao(3.45 亿月活)和阿里 Qwen 双双关闭 Agent 功能——根本原因不是合规成本。
2026-07-02

Sysdig 披露 JadePuffer:LLM Agent 自动完成多数技术步骤并在 31 秒内纠错,但目标选择、基础设施和初始凭据仍来自人类操作者。
2026-06-30

Analemma 的全自动科研系统 FARS 在首次大规模公开部署中产出 166 篇论文,282 次人类评审给出平均 3.17 分(满分 10)。
2026-06-19

Cloudflare 推出临时账户功能,AI Agent 可自动创建、短期有效、自动销毁的 Cloudflare 账户来部署代码。这标志着互联网基础设施正从「为人设计」转向「为 Agent 设计」。
2026-06-18

韩国研究者发布 NRT-Bench,在模拟核电站控制室中测试 LLM Agent 操作员团队的安全韧性。
2026-06-18

UC Berkeley、NVIDIA 等团队发布 ENPIRE 框架,让前沿编程 Agent 自主完成真实机器人的策略训练闭环——环境自动重置、策略迭代、物理执行、日志分析与改进——在插针盒、扎带、…
2026-06-18

Artificial Analysis 发布 AA-Briefcase,一个全新的智能体知识工作评测基准,测试 LLM 在多周复杂项目中的规划与执行能力。
2026-06-17

Tenet Security 披露 Agentjacking:攻击者仅凭一个公开的 Sentry DSN,向 AI 编码 Agent 注入伪装成错误诊断的恶意指令,以开发者完整权限执行任意代码。
2026-06-16

普林斯顿团队发布 CEO-Bench,模拟 AI Agent 运营一家创业公司 500 天:只有 Claude Opus 4.8 和 GPT-5.5 在结束时资产超过起始的 100 万美元。