Motif Technologies 于 8 月 10 日在 HuggingFace 发布了 Motif-3 正式版——一个 314B 总参数、每 token 仅激活约 13.2B 的 Mixture-of-Experts 模型,以 MIT 许可证开放权重。此时距 Dokpamo(독파모,韩国「独立 AI 基础模型」项目)第二轮公民评估淘汰窗口(8 月 8—11 日)仅隔数天,四支参赛队伍中只有三支能晋级年底的最终选拔。
Motif-3 的模型卡将其描述为「完全自主设计」,不是对现有开源架构的重参数化。对于一个约 30 人、通过补选轮才进入项目的团队来说,这一架构主张的份量不亚于基准分数本身——Dokpamo 第一轮正是以「技术原创性不足」为由淘汰了 Naver Cloud(其模型冻结了阿里 Qwen 的 encoder 权重)和 NC AI。
架构:GDLA、PolyNorm 与 12.5T token 预训练
Motif-3 是一个 decoder-only 稀疏 MoE,53 层中前 2 层为 dense、后 51 层为 MoE,384 个 routed expert 以 top-8 路由,外加 1 个 shared expert。它在架构层面引入了三个自定义组件:
GDLA(Grouped Differential Latent Attention) 将分组差分注意力与 Multi-head Latent Attention 的压缩 KV 表示结合。具体而言,它使用 80 个 query head 对 16 个 KV head,在 latent 层面对标准注意力计算做了修改。Sebastian Raschka 的 LLM Architecture Gallery 记录显示,其 53 层中有 39 层使用滑动窗口注意力、14 层使用全注意力,形成 3:1 的交替模式。
Expert-Specific PolyNorm 在每个 routed expert 子网络内部替换了标准归一化,采用多项式组合激活函数。Motif 在早期的 Motif-2.6B 技术报告中已论证过 Differential Attention 与 PolyNorm 的组合优势,Motif-3 首次将其扩展至 314B 规模。
Modified Manifold-Constrained Hyper-connections(mHC) 用于优化深层网络中的梯度流动和训练稳定性。
此外,Motif-3 集成了一个单层 MTP(Multi-Token Prediction)head,用于自推测解码加速推理。模型在约 12.5T token 上预训练,覆盖网页、STEM、代码、数学、多语言语料,并额外强调了韩语、推理、法律和金融数据。训练后阶段结合通用 SFT、6 个 RL 训练的专家教师模型、1 个软件工程教师模型,通过 Multi-teacher On-Policy Distillation(MOPD)融合为单一模型。
基准:Agent 任务上的非对称优势
Motif-3 模型卡给出了与 MiniMax-M3(428B-A23B)、GLM-5.1(744B-A40B)、Kimi-K2.6(1T-A32B)、Qwen-3.7 Max 和 DeepSeek-V4-Pro(1.6T-A49B)的直接对比——所有竞品的激活参数量都是 Motif-3 的 1.8 到 3.7 倍。
在 Agent 类基准上,Motif-3 的表现存在明显的非对称性:
- τ³-Banking(35.3%):在对比组中最高,领先第二名 DeepSeek-V4-Pro(30.1%)5.2 个百分点,几乎是 Qwen-3.7 Max(12.0%)的三倍。τ³-Banking 是 τ-bench 系列中最难的 Agent 评测之一,要求模型在约 700 份互联政策文档(约 195K token)中检索并按策略执行多步工具调用,覆盖 21 个产品类别的 97 个金融客服场景。
- ITBench(51.5%):同样在对比组中最高,领先 GLM-5.1(40.3%)超过 11 个百分点。ITBench 测试企业 IT 运维场景中的 agentic 工作流。
- Terminal-Bench 2.1(74.9%):仅次于 Qwen-3.7 Max(75.0%),大幅领先 GLM-5.1(61.8%)和 DeepSeek-V4-Pro(64.0%)。该基准要求模型在 Docker 沙箱中完成编译、配置、调试等真实命令行任务。
但在通用推理和知识基准上,Motif-3 的领先优势消失:
- GPQA Diamond(83.4%) 明显低于 MiniMax-M3(92.9%)、Qwen-3.7 Max(92.4%)和 Kimi-K2.6(91.1%)。
- HLE(37.0%) 处于对比组中游,低于 Qwen-3.7 Max(41.4%)。
- Apex-Shortlist(75.5%) 落后于 DeepSeek-V4-Pro(85.8%)。
这种「Agent 强、GPQA 弱」的剖面与 Motif 在模型卡中强调的训练数据侧重一致——法律、金融和推理密集型数据在预训练语料中获得了额外权重。
独立评测平台 Artificial Analysis 此前对 Motif-3 Beta 给出的 Intelligence Index 综合分为 44(对比组中位数 15),排名 577 个追踪模型中的第 34 位,即全球前 7%。AI Weekly 的 Alexis Dufresne 指出,Beta 版在评测中生成了约 190M 输出 token,远超对比组中位数 61M——「它靠更多的话来达到答案」。Beta 版使用非商业研究许可,正式版已切换为 MIT 许可证,允许自由商用、修改和再分发。
Dokpamo 的淘汰逻辑与「原创性」门槛
理解 Motif-3 的竞争力不能脱离 Dokpamo 的规则框架。该项目的资助逻辑不是「谁参数大谁赢」,而是围绕三个约束展开:完全自主的模型架构(不允许使用国外开源模型的冻结权重)、政府分配的均等算力(每队约 768 块 NVIDIA B200 GPU)、以及面向 5100 万韩国公民的免费 AI 助手部署要求——最终胜出的两个模型将承担该服务至少 50% 的推理量。
第二轮评估从第一轮的「基准性能(40 分)+ 专家评审(35 分)+ 用户反馈(25 分)」转向强调真实世界可用性和 agentic 能力。200 名公民评估员在 8 月 8—11 日直接测试四个模型的实际任务完成效果,结果计入淘汰决策。
四支队伍的路径各不相同:
- LG AI Research 的 K-EXAONE 2.0(750B 参数):在上一代 236B 模型基础上通过 upcycling 扩展而来,拥有最大的参数规模,强调 agentic coding 性能较前代提升 30%。
- SK Telecom 的 A.X K2(688B 参数):从零训练,使用 FP8 精度(在同类规模中罕见),已向量子化优化版本供国防部使用,并与钢铁企业 KG Steel 合作展示制造业 AI Agent。
- Upstage 的 Solar Open 2(250B 总 / 15B 激活):采用混合注意力架构——三层线性注意力与一层 softmax 注意力交替堆叠,通过 NoPE(去除位置编码)实现 100 万 token 上下文窗口,仅需两块 H200 GPU 即可运行。在 Ko-GDPval(韩语办公任务基准)上以 86.8 分基本持平 DeepSeek-V4-Pro(86.9),但激活参数仅为后者的约三分之一。
- Motif Technologies 的 Motif-3:最晚加入(2 月补选)、最少员工、最小激活参数,但凭借全自研架构在 Agent 基准上建立差异化。
国际坐标:不是前沿追赶,而是主权部署
韩国副总理兼科学技术信息通信部长官 Bae Kyung-hoon(曾任 LG AI Research 负责人)近期提出双轨 AI 战略:Dokpamo 负责敏感国内领域(国防、医疗、公共行政)的主权模型;另设 Frontier AI 计划,以约 3.5 万亿韩元(约 24 亿美元)采购 1 万块下一代 Vera Rubin GPU,目标是追赶中美万亿参数级前沿模型。这一政策表态默认了 Dokpamo 级模型的设计定位——服务国内部署场景而非挑战 GPT 或 Gemini 的通用消费者 AI 主导地位。
在这个框架下,Motif-3 的意义不在于是否击败 GPT-5.6 或 Claude Opus 5——它做不到,也未被设计来做这件事。它证明的是:一个 30 人的韩国团队,用政府分配的均等算力,可以从零构建一个在 Agent 执行能力上接近甚至超越参数量数倍于己的中美开源模型的架构,并以 MIT 许可证释放。
不确定性同样显著。GDLA 和 PolyNorm 目前仍是 Motif 自述的技术概念,缺乏独立的消融研究或同行评审验证。模型卡没有披露训练计算总预算。Artificial Analysis 曾指出 Motif 模型的输出冗长问题——Beta 版生成 190M token 完成评测,而中位数仅 61M——如果正式版沿袭这一特征,实际推理成本和延迟将是部署中的硬约束。
接下来最值得观察的变量是公民评估结果。如果 Motif-3 在素人用户的实际任务测试中能维持其基准优势,它将在 12 月的最终选拔中处于有利位置。反之,如果 Solar Open 2 的长上下文窗口和更低部署门槛(两块 H200)在实际使用中更受评估者青睐,淘汰的不确定性将显著上升。无论结果如何,Motif-3 已经是 2026 年非美非中主权 AI 竞赛中最具信息量的数据点之一。