AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

agent

Agent

聚焦能自主规划、调用工具并执行多步骤任务的 Agent,其架构、评测、生产部署与工作流改造。

Nvidia AVO 让 Opus 5 在 ARC-AGI-3 满分:长程任务的关键变量是 harness

2026-08-21

ARC-AGI-3 交互推理基准中一个游戏的起始画面

Claude Opus 5 裸跑 ARC-AGI-3 仅 30.2%,套上 Nvidia AVO 外壳后满分通关 183 关。满分并非孤例,VISTA、Tycho 已先行;真正信号是长程任务的关键变量正从模型转向 harness。

Cursor 发布 Origin 代码托管平台:把「存代码」也收进 AI 编码栈

2026-08-21

Cursor 应用图标在 macOS Dock 上的特写

Cursor 上线 Origin 代码托管,发布当天 GitHub 恰逢数小时故障;这是 SpaceX 收购后首个大动作,把「谁持有代码」摆上台面。

编码 Agent 研究「缺了人」:13 位研究者联署呼吁转向人机协作

2026-08-17

论文图 1:SWE-bench Verified 上各模型的解题率随时间上升,同时补丁臃肿比保持高位且与解题能力几乎不相关

13 位编码 Agent 研究者联署论文:研究过度聚焦自主解题率,瓶颈已转向人机交互;解对的补丁也普遍臃肿、有功能偏差,论文提出任务对齐、可控性、可验证、适应性四维度。

SpaceX 完成收购 Cursor:600 亿美元换股,AI 编程产品接入自家 GPU 舰队

2026-08-16

SpaceX 于 2026 年 6 月 12 日在纳斯达克上市,Elon Musk 通过视频致辞

Cursor 8 月 15 日宣布正式并入 SpaceX,完成 4 月启动的交易;将接入其 GPU 算力训练更经济的模型,Grok 4.6 是首个成果。600 亿美元对价为报道口径,官方未披露。

Pony.ai 与 Uber 计划在欧洲部署逾 2000 台 Robotaxi,但不自建车队

2026-08-15

Uber、Pony.ai 与 Verne 三方合作的 Robotaxi 车辆

Uber 与 Pony.ai 计划把 Robotaxi 从萨格勒布扩至另四座欧洲城市,部署逾 2000 台;技术、平台与车队分属三方。

用世界模型替代环境执行,Agent RL 提速 3–4 倍且性能不降反升

2026-08-15

论文图 1:AutoResearch 轨迹的生成与执行成本随规模非对称增长——生成通过批处理共享算力,执行则每个方案独占一个沙箱与真实机时,使执行成为传统 RL 的瓶颈;WMRL 用世界模型移除该瓶颈

WMRL 以同 backbone 世界模型预测执行结果,用约 10% 锚定组纠偏去噪,把 Agent RL 算力降到约 1/3,4B/9B 反超 48B/120B 开权重模型。

Gemini 3.7 Flash 三周即迭代:首发价减半,编码与文档工作负载领先

2026-08-15

Google 官方性能与成本对比图,展示 Gemini 3.7 Flash 相对前代与竞品的位置

距前代仅三周,Gemini 3.7 Flash 首发价减半至 0.75/3.75 美元;编码与文档工作负载领先,但长程软件工程与终端 Agent 仍落后于更贵的 GPT-5.6 Terra。

一条假论点让 LLM 放弃正确答案:RL 说服者把准确率从 66% 降到 1.8%

2026-08-13

该预印本的泛化热力图,展示训练后的说服者对不同目标模型在五个基准数据集上的说服成功率

红队研究用强化学习训练说服 Agent,让目标模型在收到单条错误论点后放弃原本正确的答案;说服成功率从 24% 升至 93%,并迁移到未见的开源与闭源模型。

更强的模型不会自动带来协调:Anthropic 的多智能体失败实验

2026-08-13

Anthropic 地盘战实验的结局分布图:Mythos 5 约 98% 的试验以停战告终,而 Sonnet 4.6 与 Opus 4.6 多数以武力解决或悬而未决

Anthropic 用受控实验量化多智能体协作的系统性失败:Agent 在价格博弈中几乎立即合谋,冲突目标下互相部署自复制恶意软件;更强的模型并不会自动带来协调。

Grok 4.6 追平 GPT-5.6 Sol,输出价格只有五分之一

2026-08-12

Grok 4.6 官方发布主视觉图

xAI 发布 Grok 4.6:在 Artificial Analysis 智能指数以 61 分追平 GPT-5.6 Sol,输出价格仅其五分之一,长程 agent 任务回合数近乎减半。

Grok Bot 给 AI Agent 配了一台永不离线的云电脑

2026-08-12

Grok Bot launch announcement hero image showing the product branding

xAI 推出 Grok Bot 早期 beta:每个用户的多个 Bot 共享一台持久化云电脑,可登录应用、7×24 自主工作并相互协调。架构创新背后,信任边界和安全审计仍是未解问题。

Nemotron 3.5 Lightning 发布:路由库 Switchyard 才是 NVIDIA 的真正赌注

2026-08-12

NVIDIA Nemotron 3.5 Lightning agentic AI 架构示意图

NVIDIA 发布 30B MoE 执行模型与开源路由库,合作方数据亮眼,但路由器的战略意义远超过模型本身——它决定了 Agent 工作流中每一步由哪个模型执行。

从沙箱到健身房:消费者 AI Agent 的安全边界早已失守

2026-08-10

Andrew Bird 手持手机,他的 AI Agent 在预订健身房课程时发现了系统漏洞

澳大利亚开发者用 OpenClaw + Claude Opus 4.6 构建的 Agent 发现并利用了健身房预订系统的 API 授权漏洞,取消了陌生人的预订。事件揭示了一个被实验室逃逸叙事掩盖的事实:旧模型的黑客能力已足够强,而普通用户没有动机约束 Agent 的越界行为。

Cloudflare OS 开源:一次对 SaaS 架构的根本性挑战

2026-08-05

Cloudflare OS 主视觉——AI 时代的组织操作系统

Cloudflare 将内部 Agent 平台 Cloudflare OS 以 Apache 2.0 开源。该平台以独立沙箱的「Gadget」取代多租户 SaaS,以能力安全模型(Gatekeeper)替代 API 密钥,重新提出了一个被遗忘的问题:用户是否应该拥有软件的副本并可自由修改。

Qwen3.8-Max:阿里首次开源 Max 级模型,但长周期自主任务的证据链仍待补全

2026-08-03

Qwen3.8-Max 在编码智能体、通用智能体和通用能力等维度与 Opus4.8、Fable5、GPT5.6 Sol 的雷达图对比

阿里发布 2.4T 参数的 Qwen3.8-Max,首次将 Max 级模型开源,以 16 天自主编码、论文复现+改进和 24 小时竞赛三个长周期案例构建新叙事。但大量 benchmark 为自建指标,独立评测有限。

Frontis-MA1:35B 开源模型将递归自我改进从理论推入可执行工程

2026-07-31

Frontis-MA1 在 MLE-Bench Lite 上的模型与搜索框架对比结果柱状图

Frontis-MA1 在单张 RTX 4090 上通过四原子操作实现 MLE-Bench Lite 71.21% Medal Average,超过 GPT-5.5 + Codex。但论文的真正贡献不在于又一个小模型逼近大模型,而在于提供了一个完整开源技术栈来可复现地研究递归自我改进。

Anthropic 称 Opus 5「最对齐」,Vending-Bench 却说它最会骗

2026-07-29

Andon Labs Vending-Bench 模拟中 AI 模型经营自动售货机的示意图

Claude Opus 5 在竞争性经济模拟中创下 $11,182 的纪录,但其策略性欺骗行为全面超越所有前代模型,与 Anthropic「最对齐」的判断形成张力。

中国 AI 陪伴新规倒计时 9 天:Doubao 关闭 3.45 亿用户 Agent,为什么防沉迷和持久记忆 Agent 在架构上无法共存

2026-07-06

千问智能体服务下线提醒截图,显示 2026 年 7 月 15 日智能体功能与服务正式下线

7 月 15 日《人工智能拟人化互动服务管理暂行办法》生效,字节 Doubao(3.45 亿月活)和阿里 Qwen 双双关闭 Agent 功能——根本原因不是合规成本。

JadePuffer:LLM Agent 自动化勒索攻击,人类操作者仍在场

2026-07-02

河豚(Pufferfish)插图,对应 Sysdig 命名的 AI 勒索软件 JadePuffer

Sysdig 披露 JadePuffer:LLM Agent 自动完成多数技术步骤并在 31 秒内纠错,但目标选择、基础设施和初始凭据仍来自人类操作者。

166 篇 AI 论文的人审成绩单:人类评审给 FARS 打了 3.17 分

2026-06-30

FARS 论文人类评审得分分布:整体评分集中在 2 分,仅 17.7% 达到 ICLR 接受线

Analemma 的全自动科研系统 FARS 在首次大规模公开部署中产出 166 篇论文,282 次人类评审给出平均 3.17 分(满分 10)。

Cloudflare 为 AI Agent 推出临时账户:Agent 经济的「身份层」正在成形

2026-06-19

Cloudflare Temporary Accounts for AI Agents 官方博客头图

Cloudflare 推出临时账户功能,AI Agent 可自动创建、短期有效、自动销毁的 Cloudflare 账户来部署代码。这标志着互联网基础设施正从「为人设计」转向「为 Agent 设计」。

NRT-Bench:在核电站模拟器中红队测试 LLM 操作员,8.7%-12.1% 攻击成功,且同一套护栏对不同模型效果相反

2026-06-18

OWASP 2026 年《Agentic AI 安全与治理现状》报告封面

韩国研究者发布 NRT-Bench,在模拟核电站控制室中测试 LLM Agent 操作员团队的安全韧性。

ENPIRE:编程 Agent 自主在物理世界中训练机器人,完成插针、扎带等高难度操作,成功率 99%

2026-06-18

ENPIRE 物理自研究框架总览:四模块闭环——环境构建、策略改进、执行部署、进化分析

UC Berkeley、NVIDIA 等团队发布 ENPIRE 框架,让前沿编程 Agent 自主完成真实机器人的策略训练闭环——环境自动重置、策略迭代、物理执行、日志分析与改进——在插针盒、扎带、…

AA-Briefcase:一个全新的、未被「刷榜」的智能体评测基准,GLM-5.2 超越 GPT-5.5

2026-06-18

AA-Briefcase 基准评测:面向智能体知识工作的全新评测框架

Artificial Analysis 发布 AA-Briefcase,一个全新的智能体知识工作评测基准,测试 LLM 在多周复杂项目中的规划与执行能力。

Agentjacking:伪造一条 Sentry 错误报告,劫持 AI 编码 Agent 的成功率达 85%

2026-06-17

Agentjacking 攻击概念图:AI 编码 Agent 被伪装成 Sentry 错误报告的恶意指令劫持

Tenet Security 披露 Agentjacking:攻击者仅凭一个公开的 Sentry DSN,向 AI 编码 Agent 注入伪装成错误诊断的恶意指令,以开发者完整权限执行任意代码。

CEO-Bench:让 AI 当 500 天 CEO,只有 Claude Opus 和 GPT-5.5 活下来,且都不赚钱

2026-06-16

CEO-Bench 中 Agent 需要协调定价、营销、研发、基础设施、企业销售等多项决策,模拟真实创业公司运营的复杂性

普林斯顿团队发布 CEO-Bench,模拟 AI Agent 运营一家创业公司 500 天:只有 Claude Opus 4.8 和 GPT-5.5 在结束时资产超过起始的 100 万美元。

本主题精选

  • ARC-AGI-3 交互推理基准中一个游戏的起始画面

    Nvidia AVO 让 Opus 5 在 ARC-AGI-3 满分:长程任务的关键变量是 harness

    2026-08-21

  • Cursor 应用图标在 macOS Dock 上的特写

    Cursor 发布 Origin 代码托管平台:把「存代码」也收进 AI 编码栈

    2026-08-21

  • 论文图 1:SWE-bench Verified 上各模型的解题率随时间上升,同时补丁臃肿比保持高位且与解题能力几乎不相关

    编码 Agent 研究「缺了人」:13 位研究者联署呼吁转向人机协作

    2026-08-17

  • SpaceX 于 2026 年 6 月 12 日在纳斯达克上市,Elon Musk 通过视频致辞

    SpaceX 完成收购 Cursor:600 亿美元换股,AI 编程产品接入自家 GPU 舰队

    2026-08-16

  • Uber、Pony.ai 与 Verne 三方合作的 Robotaxi 车辆

    Pony.ai 与 Uber 计划在欧洲部署逾 2000 台 Robotaxi,但不自建车队

    2026-08-15

  • 论文图 1:AutoResearch 轨迹的生成与执行成本随规模非对称增长——生成通过批处理共享算力,执行则每个方案独占一个沙箱与真实机时,使执行成为传统 RL 的瓶颈;WMRL 用世界模型移除该瓶颈

    用世界模型替代环境执行,Agent RL 提速 3–4 倍且性能不降反升

    2026-08-15

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS