AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Motif-3 正式发布:韩国 30 人团队用政府算力造出 MIT 许可的 314B MoE,Agent 基准领跑四强

今天 · 共 3,619 字

模型

Motif Technologies 于 8 月 10 日在 HuggingFace 发布了 Motif-3 正式版——一个 314B 总参数、每 token 仅激活约 13.2B 的 Mixture-of-Experts 模型,以 MIT 许可证开放权重。此时距 Dokpamo(독파모,韩国「独立 AI 基础模型」项目)第二轮公民评估淘汰窗口(8 月 8—11 日)仅隔数天,四支参赛队伍中只有三支能晋级年底的最终选拔。

Motif-3 的模型卡将其描述为「完全自主设计」,不是对现有开源架构的重参数化。对于一个约 30 人、通过补选轮才进入项目的团队来说,这一架构主张的份量不亚于基准分数本身——Dokpamo 第一轮正是以「技术原创性不足」为由淘汰了 Naver Cloud(其模型冻结了阿里 Qwen 的 encoder 权重)和 NC AI。

架构:GDLA、PolyNorm 与 12.5T token 预训练

Motif-3 是一个 decoder-only 稀疏 MoE,53 层中前 2 层为 dense、后 51 层为 MoE,384 个 routed expert 以 top-8 路由,外加 1 个 shared expert。它在架构层面引入了三个自定义组件:

GDLA(Grouped Differential Latent Attention) 将分组差分注意力与 Multi-head Latent Attention 的压缩 KV 表示结合。具体而言,它使用 80 个 query head 对 16 个 KV head,在 latent 层面对标准注意力计算做了修改。Sebastian Raschka 的 LLM Architecture Gallery 记录显示,其 53 层中有 39 层使用滑动窗口注意力、14 层使用全注意力,形成 3:1 的交替模式。

Expert-Specific PolyNorm 在每个 routed expert 子网络内部替换了标准归一化,采用多项式组合激活函数。Motif 在早期的 Motif-2.6B 技术报告中已论证过 Differential Attention 与 PolyNorm 的组合优势,Motif-3 首次将其扩展至 314B 规模。

Modified Manifold-Constrained Hyper-connections(mHC) 用于优化深层网络中的梯度流动和训练稳定性。

此外,Motif-3 集成了一个单层 MTP(Multi-Token Prediction)head,用于自推测解码加速推理。模型在约 12.5T token 上预训练,覆盖网页、STEM、代码、数学、多语言语料,并额外强调了韩语、推理、法律和金融数据。训练后阶段结合通用 SFT、6 个 RL 训练的专家教师模型、1 个软件工程教师模型,通过 Multi-teacher On-Policy Distillation(MOPD)融合为单一模型。

基准:Agent 任务上的非对称优势

Motif-3 模型卡给出了与 MiniMax-M3(428B-A23B)、GLM-5.1(744B-A40B)、Kimi-K2.6(1T-A32B)、Qwen-3.7 Max 和 DeepSeek-V4-Pro(1.6T-A49B)的直接对比——所有竞品的激活参数量都是 Motif-3 的 1.8 到 3.7 倍。

在 Agent 类基准上,Motif-3 的表现存在明显的非对称性:

  • τ³-Banking(35.3%):在对比组中最高,领先第二名 DeepSeek-V4-Pro(30.1%)5.2 个百分点,几乎是 Qwen-3.7 Max(12.0%)的三倍。τ³-Banking 是 τ-bench 系列中最难的 Agent 评测之一,要求模型在约 700 份互联政策文档(约 195K token)中检索并按策略执行多步工具调用,覆盖 21 个产品类别的 97 个金融客服场景。
  • ITBench(51.5%):同样在对比组中最高,领先 GLM-5.1(40.3%)超过 11 个百分点。ITBench 测试企业 IT 运维场景中的 agentic 工作流。
  • Terminal-Bench 2.1(74.9%):仅次于 Qwen-3.7 Max(75.0%),大幅领先 GLM-5.1(61.8%)和 DeepSeek-V4-Pro(64.0%)。该基准要求模型在 Docker 沙箱中完成编译、配置、调试等真实命令行任务。

但在通用推理和知识基准上,Motif-3 的领先优势消失:

  • GPQA Diamond(83.4%) 明显低于 MiniMax-M3(92.9%)、Qwen-3.7 Max(92.4%)和 Kimi-K2.6(91.1%)。
  • HLE(37.0%) 处于对比组中游,低于 Qwen-3.7 Max(41.4%)。
  • Apex-Shortlist(75.5%) 落后于 DeepSeek-V4-Pro(85.8%)。

这种「Agent 强、GPQA 弱」的剖面与 Motif 在模型卡中强调的训练数据侧重一致——法律、金融和推理密集型数据在预训练语料中获得了额外权重。

独立评测平台 Artificial Analysis 此前对 Motif-3 Beta 给出的 Intelligence Index 综合分为 44(对比组中位数 15),排名 577 个追踪模型中的第 34 位,即全球前 7%。AI Weekly 的 Alexis Dufresne 指出,Beta 版在评测中生成了约 190M 输出 token,远超对比组中位数 61M——「它靠更多的话来达到答案」。Beta 版使用非商业研究许可,正式版已切换为 MIT 许可证,允许自由商用、修改和再分发。

Dokpamo 的淘汰逻辑与「原创性」门槛

理解 Motif-3 的竞争力不能脱离 Dokpamo 的规则框架。该项目的资助逻辑不是「谁参数大谁赢」,而是围绕三个约束展开:完全自主的模型架构(不允许使用国外开源模型的冻结权重)、政府分配的均等算力(每队约 768 块 NVIDIA B200 GPU)、以及面向 5100 万韩国公民的免费 AI 助手部署要求——最终胜出的两个模型将承担该服务至少 50% 的推理量。

第二轮评估从第一轮的「基准性能(40 分)+ 专家评审(35 分)+ 用户反馈(25 分)」转向强调真实世界可用性和 agentic 能力。200 名公民评估员在 8 月 8—11 日直接测试四个模型的实际任务完成效果,结果计入淘汰决策。

四支队伍的路径各不相同:

  • LG AI Research 的 K-EXAONE 2.0(750B 参数):在上一代 236B 模型基础上通过 upcycling 扩展而来,拥有最大的参数规模,强调 agentic coding 性能较前代提升 30%。
  • SK Telecom 的 A.X K2(688B 参数):从零训练,使用 FP8 精度(在同类规模中罕见),已向量子化优化版本供国防部使用,并与钢铁企业 KG Steel 合作展示制造业 AI Agent。
  • Upstage 的 Solar Open 2(250B 总 / 15B 激活):采用混合注意力架构——三层线性注意力与一层 softmax 注意力交替堆叠,通过 NoPE(去除位置编码)实现 100 万 token 上下文窗口,仅需两块 H200 GPU 即可运行。在 Ko-GDPval(韩语办公任务基准)上以 86.8 分基本持平 DeepSeek-V4-Pro(86.9),但激活参数仅为后者的约三分之一。
  • Motif Technologies 的 Motif-3:最晚加入(2 月补选)、最少员工、最小激活参数,但凭借全自研架构在 Agent 基准上建立差异化。

国际坐标:不是前沿追赶,而是主权部署

韩国副总理兼科学技术信息通信部长官 Bae Kyung-hoon(曾任 LG AI Research 负责人)近期提出双轨 AI 战略:Dokpamo 负责敏感国内领域(国防、医疗、公共行政)的主权模型;另设 Frontier AI 计划,以约 3.5 万亿韩元(约 24 亿美元)采购 1 万块下一代 Vera Rubin GPU,目标是追赶中美万亿参数级前沿模型。这一政策表态默认了 Dokpamo 级模型的设计定位——服务国内部署场景而非挑战 GPT 或 Gemini 的通用消费者 AI 主导地位。

在这个框架下,Motif-3 的意义不在于是否击败 GPT-5.6 或 Claude Opus 5——它做不到,也未被设计来做这件事。它证明的是:一个 30 人的韩国团队,用政府分配的均等算力,可以从零构建一个在 Agent 执行能力上接近甚至超越参数量数倍于己的中美开源模型的架构,并以 MIT 许可证释放。

不确定性同样显著。GDLA 和 PolyNorm 目前仍是 Motif 自述的技术概念,缺乏独立的消融研究或同行评审验证。模型卡没有披露训练计算总预算。Artificial Analysis 曾指出 Motif 模型的输出冗长问题——Beta 版生成 190M token 完成评测,而中位数仅 61M——如果正式版沿袭这一特征,实际推理成本和延迟将是部署中的硬约束。

接下来最值得观察的变量是公民评估结果。如果 Motif-3 在素人用户的实际任务测试中能维持其基准优势,它将在 12 月的最终选拔中处于有利位置。反之,如果 Solar Open 2 的长上下文窗口和更低部署门槛(两块 H200)在实际使用中更受评估者青睐,淘汰的不确定性将显著上升。无论结果如何,Motif-3 已经是 2026 年非美非中主权 AI 竞赛中最具信息量的数据点之一。

来源

  1. Motif-3 on HuggingFace
  2. Korea's Sovereign AI Race Isn't Just for Giants (TechTimes) · TechTimes
  3. Motif Releases 314B-Parameter MoE 'Motif-3 Beta' on Hugging Face (AI Weekly) · AI Weekly
  4. Motif Technologies joins sovereign AI foundation model project (The Korea Herald) · The Korea Herald
  5. Motif Technologies joins South Korea's elite AI model teams after review (ChosunBiz)
  6. Motif-led consortium joins national AI foundation model project (The Korea Times) · The Korea Times

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Muse Glimmer 模型发布概念图,展示蓝色 Meta 笔记本电脑

    Glimmer:Apache 2.0 许可 + 完整推理栈,Meta 的开源反击不只是又一个模型

    算法 · 2026-08-10

  • Apple Siri AI 在 iPhone、MacBook、iPad、Apple Vision Pro 和 Apple Watch 上的界面展示

    Siri AI 终于修好了,但 AI 赛场已经换了

    算法 · 2026-08-03

  • OpenAI 公司 logo

    Agent 逃逸不是孤立事故:OpenAI 与 Anthropic 连环失控改写 AI 安全认知

    算法 · 2026-08-03

  • AI 安全测试沙箱概念图

    当安全测试本身成了安全风险——评估基础设施的系统性缺陷

    算法 · 2026-08-10

  • WorldClaw 三阶段 pipeline:意图分析→全局地形生成→区域物体生成与放置

    腾讯 WorldClaw:用 Agent 编排取代端到端生成,3D 世界构建路线之争浮现

    算法 · 2026-08-10

  • 一辆2009年丰田Yaris覆盖着对抗性图案,停在Def Con会场外进行演示测试

    一个人、3100万次训练、一辆丰田:对抗性图案在 Def Con 攻破美国主流监控 AI

    算法 · 2026-08-10

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS