AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

腾讯 WorldClaw:用 Agent 编排取代端到端生成,3D 世界构建路线之争浮现

今天 · 共 4,073 字

模型

腾讯混元团队 8 月 5 日发布 WorldClaw,一个文本提示到完整 3D 开放世界的 agentic 生成框架。与 HY-World 2.0 的全景图—3D 重建路线不同,WorldClaw 的核心设计决策是:不训练一个大模型来一次性生成整个世界,而是让一个 LLM Agent 充当总导演,编排多个专业模型分工协作。这一选择引发了比论文本身更值得讨论的问题——当 AI 系统越来越复杂,我们该押注一个全能模型,还是一组可替换的专家?

三阶段流水线:从文本到可编辑世界

WorldClaw 的架构围绕一个洞察展开:全局连贯的世界不需要一次性生成所有内容。"场景语义、空间组织和地形基础可以先在全局建立,而各个区域独特的物体和局部关系则按需逐步实现。"系统分三个阶段运行:

意图分析与规划。 用户输入一句话描述后,意图分析 Agent 提取显式约束——场景类型、视觉风格、关键区域和物体、空间关系。场景规划 Agent 随后补全遗漏信息,生成结构化场景规格,包括区域组成、地形需求和物体规格。当文本不足以表达复杂空间关系时,Agent 还会调用搜索工具获取参考,并生成概念图作为视觉条件。

全局地形生成。 地形规划 Agent 将场景规格细化为可执行的地形参数——区域类别、高程基线、噪声频率和振幅、地貌算子和权重。GPT-Image-2 生成语义布局图,用颜色编码不同地形类别。Hunyuan3D 将参考图像转化为可复用的 3D 资产原型(岩石、植被簇等)。随后系统利用区域感知的高度场公式构建复合地形——不同地貌通过软权重边界自然过渡,而非刚性切割。BlenderMCP 连接的渲染 Agent 从预设视角检查几何、材质和散射结果,迭代修正直到无可检测问题。

区域物体生成与放置。 系统选择需要精细内容的区域,渲染当前地形图像,用图像编辑模型在此图像上合成物体。SAM3 从合成图中分割出每个物体实例,SAM3D 将其重建为独立纹理网格。放置算法通过双射线匹配将物体精确对位到地形表面,并对齐尺度和方向。最后的场景优化 Agent 检查物体—地形接触关系,修正漂浮、穿透和不稳定支撑,必要时对物体和支撑地形进行局部协同变形。

整个过程产出的不是单一 mesh 或 3D Gaussian,而是独立可编辑的纹理网格集合,带显式地形放置变换,可直接导入 Blender、Unity 和 Unreal Engine。

论文展示了四个代表性世界:热带海盗岛、河湾部落聚落、沙漠战场和雪山未来设施。与 SynCity、Marble(World Labs)、MajutsuCity、WorldGen 和 GPT-5.6 Sol 的定性对比中,WorldClaw 在地形表现力、区域语义组织和内容对齐方面均展现明显优势。对比方法的地形普遍偏平坦、区域过渡模糊或内容重复度高,而 WorldClaw 生成的地形有明显高程变化和连续但语义独立的区域。

为什么用 Claude Opus 4.8,而不是自研模型

Implementation Details 中一句话很值得注意:"WorldClaw uses Claude Opus 4.8 as the underlying agent model."

腾讯拥有完整的自研大模型栈——Hunyuan 2.0(406B)、Hy3preview(295B)以及 Hunyuan-T1 推理模型——却选择 Anthropic 的模型作为规划 Agent。论文没有解释原因,但可以合理推断几点:

第一,Claude Opus 4.8 在 agentic planning 任务上确有领先优势。在 GDPval-AA Leaderboard 上,Opus 4.6 即已达到 Elo 1606,领先 GPT-5.2 近 150 分;Opus 4.8 在结构化的多步规划、工具调用和子任务编排上进一步强化。WorldClaw 的地形规划 Agent 需要将高层语义转化为精确的数值参数(噪声频率、地貌算子权重、边界混合宽度),这本质上是高度结构化的代理任务。

第二,WorldClaw 的架构设计本身是模型无关的。规划 Agent 通过标准化的结构化中间表示与下游模块通信,任何一个支持工具调用的 LLM 都可以接入。这意味着未来可以替换为更强的模型或自研模型,而不需要重新设计整个流水线。

第三,这个选择客观上证明了 Agent 编排路线的核心优势:每个环节可以选择最优工具,而不是被单一模型的性能天花板限制。

路线对垒:Agent 编排 vs End-to-End Omni-Model

WorldClaw 的上线时间与 NVIDIA Cosmos 3 的发布仅隔两个月,两者恰好代表了 3D 世界生成的两条对立技术路线。

NVIDIA Cosmos 3(5 月 31 日 GTC Taipei 发布)使用了 Mixture-of-Transformers 架构,在同一模型中运行两个塔:左侧自回归塔负责视觉推理,右侧扩散塔负责世界生成。一个模型统一处理文本、图像、视频、环境音和机器人动作信号。Cosmos 3 之前,开发者需要用四个独立模型分别处理世界生成、受控生成、场景理解和策略生成;现在所有这些能力折叠进一个架构。

两条路线的差异本质上是 AI 系统的两种设计哲学:

维度 WorldClaw(Agent 编排) Cosmos 3(End-to-End)
核心机制 LLM Agent 编排多个专业模型 单一 MoT 模型统一处理
模型依赖 Claude + GPT-Image-2 + SAM3 + SAM3D + Hunyuan3D 一个模型(Super / Nano / Edge)
输出形式 独立可编辑纹理网格 + 显式放置 视频帧 / 图像 / 动作序列 / 音频
可编辑性 实例级,直接进入游戏引擎 作为合成数据或仿真输入
部署 4×H20 GPU,Blender 5.1.1 TensorRT-LLM / vLLM 推理
开闭源 论文公开,代码/权重未说明 完全开源(OpenMDW-1.1 许可)

Agent 编排的优势在于灵活性和可解释性。每个中间表示都可以检查、修改和单独优化。地形布局图、资产原型和材质都是显式的,传统 3D 艺术家可以在任何阶段介入调整。如果 SAM3D 的物体重建质量不够,可以换成下一代替换模型而不影响整条流水线。但这种架构的代价也很明显:需要多轮 LLM 调用和多模型协同,推理时间长、硬件需求高,且存在多模型间的误差传播风险。

End-to-End 路线的优势在于简洁和效率。Cosmos 3 一次前向传播即可生成完整输出,没有多模型协调的复杂性。NVIDIA 将其定位为物理 AI 的基础模型,目标场景是机器人仿真和自动驾驶训练,这些场景需要高频的视频和动作生成,而对场景的实例级编辑需求相对较低。但其劣势同样明显:单一模型的能力边界限制了内容多样性和几何精度,生成结果偏向统计上合理而非结构上精确。

WorldClaw 论文的对比实验验证了这一判断。与同类端到端方法相比,WorldClaw 输出的每个物体都是独立的纹理网格,保留了实例级可编辑性。Marble 和 SynCity 的输出要么是不可拆分的高斯球,要么是块级 latent,"不暴露独立可控的物体资产"。WorldGen 也生成显式网格,但地形更平坦、内容变化有限;GPT-5.6 Sol 的物体几何简化、材质基础,看起来"像 blockout 阶段的产物"。

腾讯的 3D 版图:两条线并行

WorldClaw 不是腾讯在 3D 领域的孤立发布,而是一条持续演进路线的最新节点。理解这条路线需要区分两个并行方向:

物体级 3D 生成。 Hunyuan3D 系列从 2024 年的 1.0 一路迭代到 2025 年的 2.0 和 3.0,从文本或图像生成单个 3D 资产。该系列在 HuggingFace 上累计下载超 260 万次,是全球最受欢迎的开源 3D 模型。在 WorldClaw 中,Hunyuan3D 承担了资产原型生成和物体质量优化的角色。

世界级 3D 生成。 HunyuanWorld 1.0(2025 年 7 月)首创了全景图代理→语义分层→3D 重建的路线,是首个开源的可探索 3D 世界生成系统。1.5(WorldPlay,2025 年 12 月)支持实时世界创建。HY-World 2.0(2026 年 4 月)引入四阶段流水线——HY-Pano 2.0 全景生成、WorldNav 路径规划、WorldStereo 2.0 视图扩展和 WorldMirror 2.0 三维重建——成为开源 SOTA 3D 世界模型。

WorldClaw 与 HY-World 2.0 的技术路线完全不同:HY-World 走的是 visual-prior-based 路线——先生成 2D 全景图,再通过多视图几何升维到 3D;WorldClaw 走的是 Agent 编排路线——让 LLM 规划和协调多个专用工具分步构建。两者不是替代关系,而是互补。HY-World 擅长从真实照片或视频重建可探索场景;WorldClaw 擅长从纯文本出发构建有精细地形和可编辑资产的大规模世界。

值得注意的是,HY-World 2.0 的 WorldMirror 2.0 代码和权重已开源,而 WorldClaw 论文截至 8 月 10 日没有明确代码或权重发布计划。这一差异可能反映了两种策略:HY-World 面向社区和研究者,WorldClaw 可能更倾向于内部生产工具——论文中使用 BlenderMCP 连接 3D 引擎进行场景生成和优化,暗示了与游戏和影视制作流程的深度整合。

局限与待回答的问题

论文本身展示的是四个精心挑选的案例,每个世界在一个或多个区域生成物体。大规模部署时,区域选择策略能否在保持质量的同时覆盖足够多样的场景,尚需验证。物体生成依赖于 SAM3D 的单视图重建,面对严重遮挡或不常见视角时,重建质量必然下降。论文未提供定量指标(如 FID、CLIP-score 等),仅做定性对比。

更根本的问题在于:Agent 编排路线虽然灵活,但推理成本高昂。WorldClaw 的三阶段流水线涉及多次 LLM 调用和多次图像/3D 生成,单次生成的延迟和资源消耗可能远超端到端方案的数秒到数十秒。在需要快速迭代的游戏原型阶段,开发者是否愿意等,取决于生成质量能高出多少。

关于是否开源,以及是否计划替换或支持自研模型作为规划 Agent,论文均未提及。腾讯混元团队此前有持续开源的传统,Hunyuan3D 系列和 HY-World 系列均开源了权重。WorldClaw 的后续动作将是判断其长期战略方向的关键信号。

来源

  1. WorldClaw: Agentic 3D Open-World Generation at Scale (arXiv) · arXiv
  2. NVIDIA Cosmos 3: Open Physical-AI Omnimodel Guide 2026
  3. NVIDIA Launches Cosmos 3, the Open Frontier Foundation Model for Physical AI · NVIDIA
  4. HY-World 2.0 Technical Report (arXiv) · arXiv
  5. Hunyuan3D-2 HuggingFace
  6. Tencent launches updated Hunyuan 3D 3.0 platform · VoxelMatters
  7. LocalLLaMA community discussion on WorldClaw

评论

登录后即可参与评论。

加载评论中…

相关文章

  • 智能手机屏幕上显示 Google Maps 图标

    Google Maps 变身 Agent:嵌入超级应用,比通用浏览器更务实

    算法 · 2026-08-06

  • Waymo 第五代 robotaxi 车顶传感器阵列特写

    达拉斯全量开放的背面:Waymo 规模化正在兑现,但天气暴露了自动驾驶的结构性边界

    算法 · 2026-08-04

  • ComfyUI 优化前后 MiniMax H3 内存占用对比图:全精度 123.6GB 降至优化后 42.5GB,降低 66%

    MiniMax H3 开源:首个登顶视频评测的开放权重模型,但「开放」的边界在哪里

    算法 · 2026-08-03

  • 一辆2009年丰田Yaris覆盖着对抗性图案,停在Def Con会场外进行演示测试

    一个人、3100万次训练、一辆丰田:对抗性图案在 Def Con 攻破美国主流监控 AI

    算法 · 2026-08-10

  • Seedance 2.5 与 2.0 对比:30秒连续生成能力升级示意

    字节跳动发布 Seedance 2.5:30秒一镜到底,视频生成进入可控叙事时代

    算法 · 2026-07-31

  • Rippling AI Spend Console 仪表盘,展示各团队的 AI 支出与代码产出对比

    Tokenmaxxing 退潮:Rippling 月烧百万美元后的企业 AI 成本治理觉醒

    算法 · 2026-08-07

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS