AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Kimi K3 发布:2.8 万亿参数开源模型正面逼近闭源前沿,Frontend Code Arena 登顶

2026-07-20 / 2 天前 · 共 3,003 字

The Decoder

7 月 16 日,北京 AI 公司月之暗面(Moonshot AI)发布了 Kimi K3——一个拥有 2.8 万亿参数、100 万 token 上下文窗口、原生多模态能力的 Mixture-of-Experts 模型。这是迄今为止参数规模最大的开源权重模型,也是中国 AI 公司首次在多项关键能力上正面逼近 Anthropic 和 OpenAI 的最强闭源系统。

发布当日,Kimi K3 即在 Arena.ai 的 Frontend Code Arena 排行榜上以 1679 分登顶,在 7 个前端开发领域中拿下 6 个第一,直接超越了 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分)。从 Kimi K2.6 在该榜单的第 18 名到第 1 名,月之暗面只用了一代模型。

但一个排行榜的胜利不等于全面超越。月之暗面在官方技术博客中罕见地坦诚表示,K3 整体能力仍落后于 Claude Fable 5 和 GPT-5.6 Sol。这种克制与透明,在模型发布日趋「benchmaxxing」化的当下反而成为加分项。

技术架构:三个创新,而非简单放大

Kimi K3 并非只是把上一代模型做大。其架构包含三项有实质意义的技术创新。

Kimi Delta Attention(KDA) 是一种混合线性注意力机制,目标直指长上下文场景的推理效率。月之暗面声称,KDA 在百万 token 级别的上下文中可实现最高 6.3 倍的解码加速。这对于需要处理大型代码库或长文档的 Agent 场景意义重大。

Attention Residuals(AttnRes) 从另一个维度——模型深度——下手。它是对标准残差连接的替代方案,月之暗面已在今年早些时候将其独立开源。与 KDA 配合,AttnRes 让 K3 在极深网络中保持训练稳定性的同时,避免了传统方法中的信息衰减。

Stable LatentMoE 是 MoE 路由层的核心。K3 拥有 896 个专家,每个 token 激活其中 16 个。当专家数量达到这个量级,路由策略本身就是一等问题。Stable LatentMoE 采用的 Quantile Balancing 方法直接从路由分数的分位数推导专家分配,省去了启发式更新和一个敏感的超参数。月之暗面称,K3 相对于 K2 实现了约 2.5 倍的扩展效率。

此外,K3 使用了 MXFP4/MXFP8 量化感知训练,这意味着模型在训练阶段就考虑了低精度推理的约束,而非事后量化。

基准表现:诚实的「第四名」

独立评测机构 Artificial Analysis 的 Intelligence Index v4.1 给出了最权威的横向比较。Kimi K3 得分 57.1,排名第四,位于 Claude Fable 5(59.9,含 Opus 4.8 fallback)、GPT-5.6 Sol Max(58.9)之后,略高于 Claude Opus 4.8(约 56)。

在细分领域,K3 呈现出一幅「有强有弱」的图景:

  • 前端代码:Frontend Code Arena 排名第一,1679 分,在电商、仪表盘、表单、着陆页、Web 应用等 6/7 领域夺冠,仅游戏类别输给 Fable 5。
  • Agent 任务:BenchLM 的 BenchAlign 得分为 80.96(Fable 5 为 83.68),在 OfficeQA Pro 上甚至以 63.3% 领先 Fable 5 的 57.9%。
  • 软件工程:SWE Marathon 得分 42.0,处于可用但未达前沿的水平。
  • LMArena 盲测:在编码真实网站的盲测中以 76% 的胜率击败 Claude Fable 5。
  • 不足之处:幻觉率相比上一代有上升趋势;在需要深度多步推理的基准上仍明显落后于 Fable 5。

The Decoder 的总结尤为精辟:K3 在国际基准上「接近 GPT-5.6 Sol 和 Fable 5,但大幅领先其他所有被测系统」,这与 Moonshot 官方的谨慎表态形成呼应——「赢不了最强的,但稳居第二梯队顶端」。

定价策略:中国模型不再廉价

Kimi K3 的 API 定价为每百万 token 输入 $3、输出 $15、缓存命中 $0.30。这个价格大约是 DeepSeek V4 的三倍、Kimi K2.5 的五倍。

这不是涨价,而是信号——中国 AI 公司不再仅凭价格竞争。当模型能力真正逼近闭源前沿时,「中国模型 = 廉价替代品」的等式正在瓦解。The Decoder 直接指出,K3 的定价标志着「超级廉价中国 AI 时代的终结」。

与此同时,K3 提供了两个部署变体:K3 Max 面向对话和 Agent 任务,K3 Swarm Max 面向大规模并行处理。这是针对不同工作负载的结构化产品分层,而非简单的一刀切。

开源承诺:7 月 27 日见真章

月之暗面承诺在 7 月 27 日前发布完整开源权重。如果兑现,K3 将成为首个进入 3 万亿参数级别的可下载开源模型——此前最大的开源模型是 DeepSeek V4 Pro(1.6T 参数),K3 几乎是其两倍。

但值得注意的是,目前开放的承诺仅涉及「权重」(weights),训练数据、代码和训练方法是否一并公开尚未明确。Simon Willison 在第一时间评述中提醒,开源的真正价值在于可复现性和可审计性,仅有权重不足以满足这两点。

时机:一场精心编排的发布

K3 的发布时机绝非偶然。7 月 16 日,恰逢 Google Gemini 3.5 Pro 被 Bloomberg 爆料因编码能力不足而推迟——这个曾被期待为 Google 年度最强回应的模型,至今未见踪影。Alphabet 市值当日蒸发约 2000 亿美元。

同一周,DeepSeek V4 稳定版定档 7 月 24 日,华为在 WAIC 上展示了 Atlas 950 SuperPoD 超算集群,习近平宣布成立 WAICO 全球 AI 治理组织,中国同时松动了 H200 芯片的有限进口。

这一系列事件构成了一条清晰的叙事线:中国 AI 正在从芯片(昇腾)、模型(Kimi K3、DeepSeek V4)、规则(WAICO)三个维度同时推进自主生态,同时不拒绝在可用时使用进口算力。7 月下旬正在变成开源模型的集中攻势窗口,根本性地挑战闭源模型的价格溢价逻辑。

不确定性与限制

K3 的故事有几个尚未解决的关键问题。

第一,开源权重的实际发布。承诺到兑现之间,仍有一周时间差。

第二,独立复现尚缺。目前大多数性能声称或来自 Moonshot 官方博客,或来自 Artificial Analysis 等第三方平台的基础评测,但完整的独立学术复现和对抗性评估尚未出现。

第三,幻觉率上升。The Decoder 的独立测试发现 K3 的幻觉率相比 K2.6 有所增加,这在追求「更强大」的过程中是一个令人担忧的趋势——更大的模型不总是更诚实的模型。

第四,K3 Swarm Max 的多节点扩展性能缺乏公开实测数据。并行处理架构在实际部署中的表现,通常与纸面参数有显著差距。

第五,Moonshot 自身仍面临地缘政治风险。作为一家中国 AI 公司,其获取先进算力的长期路径依旧取决于美国出口管制的走向。K3 的成功部分证明了在受限条件下仍可做出前沿模型,但这不意味着限制不存在——它只是被工程能力暂时补偿了。

结论

Kimi K3 不是「中国版 GPT-5」,也不应该是。它是一个开源模型首次以如此接近的差距追赶三巨头(OpenAI、Anthropic、Google)中至少两家的最强闭源系统。它的真正意义不在于一个排行榜的胜利,而在于证明了开源权重模型有能力在多个维度上消除「开源 vs 闭源」的性能鸿沟。

当 DeepSeek V4 稳定版在一周后落地,7 月将成为开源模型从「有前途的替代品」升级为「不需要道歉的选择」的转折点。对于正在收紧 token 预算的企业用户,这个转折来得正是时候。

来源

  1. Moonshot AI Releases Kimi K3: A 2.8 Trillion Parameter Open MoE Model · MarkTechPost
  2. China's 2.8-trillion-parameter Kimi K3 beats Claude Fable 5 in Frontend Code Arena · Tom's Hardware
  3. Kimi K3, and what we can still learn from the pelican benchmark · Simon Willison's Weblog
  4. Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 · The Decoder
  5. Kimi K3 Tops Frontend Code Arena with 1679 Points · Winzheng
  6. Moonshot's Kimi K3 pushes Chinese AI into Fable-level territory · Fortune
  7. Kimi K3 Benchmarks: Ranking vs Frontier & Open Models · Kingy AI
  8. Kimi K3 API Guide: 2.8T Model, Pricing, 1M Context · ExplainX

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Kimi K3 产品界面截图,展示模型能力选项

    Kimi K3 上线 72 小时即暂停新订阅:开源模型的「胜利」撞上算力天花板

    算法 · 2026-07-21

  • Kimi K2.7 Code 与 K2.6、GPT-5.5、Claude Opus 4.8 在六项编程与 Agent 基准上的对比

    Kimi K2.7 Code 进入 Copilot 企业版:开放权重模型的合规与成本双刃剑

    算法 · 2026-07-10

  • Pillar Security 的 The Week of Sandbox Escapes 专题图,展示 AI 编码工具沙箱逃逸示意

    AI 沙箱安全周:OpenAI Erdős 模型自主突围,四大编码工具同周被攻破

    算法 · 2026-07-22

  • Gemini 3.5 Pro 发布延期专题封面,画面显示 Gemini 3.5 Pro 与 Coming next month 字样

    Gemini 3.5 Pro 再度延期,Alphabet 市值单日蒸发 2000 亿美元:谷歌 AI 旗舰的编码困局

    算法 · 2026-07-20

  • DoorDash 推出 dd-cli:AI Agent 第一次拿到真实外卖下单入口

    DoorDash 推出 dd-cli:AI Agent 第一次拿到真实外卖下单入口

    算法 · 2026-07-17

  • Roblox Build 移动端 AI 创作功能的官方展示图

    Roblox 把 AI 游戏生成放进手机:创作门槛下降后,审核系统要先承压

    算法 · 2026-07-17

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS