7 月 27 日,Moonshot AI 按两周前的承诺,将 Kimi K3 的完整模型权重上传至 HuggingFace。这一动作本身并没有带来新的性能数字——所有 benchmark 自 7 月 16 日模型公开以来已经见诸模型卡和技术博客——但它把 K3 从一个「API 可调用但无法独立验证」的厂商声明,变成了一个「社区可下载、可部署、可审查」的开放系统。
K3 的规格本身已经无需重复铺垫:2.8 万亿总参数,MoE 架构,896 个专家中每 token 激活 16 个(外加 2 个共享专家),1M token 上下文窗口,原生多模态输入。它是全球首个开放权重的 3T 级模型,在参数规模上超过 DeepSeek V4 Pro(1.6T)和 GLM-5.2(753B)一个身位。
但与 7 月 16 日初次亮相时围绕 benchmark 排名的兴奋不同,权重发布后社区的第一反应集中在另一个问题上:谁能跑得动它?答案很直接——几乎没有人。
架构:不是堆参数,而是让参数值钱
K3 真正的技术叙事不在「2.8T」这个数字上,而在让它成为可能的三个架构决策。
Kimi Delta Attention (KDA) 替代了 K2 系列使用的 Multi-head Latent Attention (MLA)。Moonshot 没有详细公开 KDA 与 MLA 的逐项差异,但从模型卡的层构成(69 层 KDA + 24 层 Gated MLA + 1 层 Dense)可以看出,KDA 并非完全取代了 MLA,而是与 Gated MLA 混合使用。Moonshot 声称这一组合实现了相比 K2 约 2.5 倍的整体扩展效率提升——这意味着同等算力下,模型从规模增长中获得的智能增益更大。
Attention Residuals (AttnRes) 是另一个关键组件。传统 Transformer 中每层的注意力输出按固定路径向上传递;AttnRes 允许模型选择性检索跨深度的表示,而非均匀累积。这一设计的直接效果是让更深层的注意力计算不必为浅层的冗余信息支付成本。
Stable LatentMoE 则是 K3 的 MoE 层能够扩展到 896 个专家而不崩溃的原因。在如此高的稀疏度下(896 选 16),路由优化和训练稳定性从次要问题升级为一阶挑战。Moonshot 引入了 Quantile Balancing——直接基于路由器分数的分位数分配专家容量,消除了启发式更新和一个敏感的超参数——以及 Per-Head Muon,让每个注意力头独立优化。这些选择让 2.8T 规模的训练在稳定性上没有翻车。
此外,K3 从 SFT 阶段开始就使用 MXFP4 权重量化感知训练(QAT),而非事后量化。这意味着 594GB 的 BF16 等效权重文件从设计之初就针对低精度推理做了优化,而不是在训练完成后再进行有损压缩。
Benchmark:前沿水平,但不是 Fable/Sol 的替代品
从自报和独立评测的交叉视角看,K3 的定位相当清晰:它在开源模型中无可争议地领先,但在闭源前沿面前仍有一到两个台阶的差距。
Artificial Analysis 给出的 Intelligence Index 分数为 57,位列 Claude Opus 4.8(56)和 GPT-5.5(57)之间,落后于 Claude Fable 5(60)和 GPT-5.6 Sol(59)。在 AA-Briefcase(智能体知识工作)上,K3 的 Elo 达到 1547,比 K2.6 跃升 732 分,仅次于 Fable 5。GDPval-AA v2(真实世界 Agent 场景)的 1668 Elo 超过了 GLM-5.2 和 GPT-5.5。
Moonshot 的自报 benchmark 表格覆盖了 40+ 项评测。最突出的成绩包括:BrowseComp 91.2(在上下文压缩策略下)、Terminal-Bench 2.1 88.3、SWE-Marathon 42.0(领先 Fable 5 的 35.0 和 Sol 的 39.0),以及 MCPMark-Verified 94.5(大幅领先 Fable 5 的 87.4)。
但 benchmark 的解读需要额外小心。Moonshot 自承在 SWE-Marathon 上使用了基于 H20 重新校准的评测分支(非官方 v1.1 最终版),且 Fable 5 在 35% 的任务中触发了 fallback,可能低估了其真实表现。在 PostTrainBench 上也使用了 H20 而非官方要求的 H100 环境。此外,多个评测使用了 Kimi Code 自有 harness 而非社区标准工具,无法与使用 Claude Code 或 Codex harness 的竞品做等精度比较。
更值得关注的是幻觉率的显著上升。Artificial Analysis 的 AA-Omniscience 数据显示,K3 的准确率从 K2.6 的 33% 提升到 46%,但幻觉率也从 39% 上升到 51%。更高的准确率几乎完全以更高的幻觉率为代价——这是一个典型的能力-可靠性 trade-off,在需要信任答案的场景中需要格外注意。
Moonshot 在模型卡中也坦承了 K3 的局限性:对话体验明显落后于 Fable 5 和 Sol,对多轮对话中的思考历史高度敏感(如果 harness 未能完整传递历史推理内容,生成质量会剧烈波动),以及在模糊指令下倾向于「过度主动」——替用户做不必要的决定。
部署账单:8 块 H100 只是入场券
权重发布暴露了 K3 最尖锐的矛盾:它标榜「开放」,但开放的对象几乎仅限于拥有企业级 GPU 集群的组织。
594GB 的 BF16 权重文件意味着最低部署门槛是 4 块 H100 80GB(总计 320GB VRAM),且只能运行缩减上下文(128K-256K token)的版本,仅适合实验性测试。生产环境需要 8 块 H100 80GB(640GB VRAM)才能支撑 512K 上下文,或 8 块 H200 141GB(1.1TB VRAM)才能跑到完整的 1M 上下文。Moonshot 官方的推荐更激进:64 个以上加速器的 supernode 配置,以充分利用 KDA 对大带宽通信域的需求。
即使是最激进的社区量化——Q4 级别约 300-400GB——也无法让 K3 在消费级硬件上运行。一台 512GB 统一内存的 M4 Ultra Mac Studio 理论上能加载 Q4 权重,但统一内存的带宽(400-800 GB/s)仅为 H100 HBM3 带宽的十分之一,实际 token 生成速度将低于 1 tok/s。
这提出了一个根本性问题:当一个「开源」模型的部署门槛高到只有云厂商和大型企业能够跨越时,「开放权重」对社区的实际价值是什么?答案是审计和研究,而非部署。第三方可以独立验证 Moonshot 的 benchmark 声明、审查训练数据痕迹、研究架构决策的实际效果,以及在不同量化级别下测量性能退化——这些都是在仅提供 API 时无法做到的事。
Moonshot 也为这一现实做了务实布局:API 定价 $3.00/MTok 输入(缓存命中 $0.30)和 $15.00/MTok 输出,是 K2.6 定价的约 3-4 倍,也是中国 AI 实验室迄今最贵的模型定价。但即使在这个价位,单任务成本($0.94)仍然与 GPT-5.6 Sol($1.04)基本持平,约为 Opus 4.8 的一半。
竞争位置:开源领头羊,但成本优势不再
K3 的发布让开源模型的竞争格局变得更加分层。
在绝对能力上,K3 是开源阵营中唯一能与 Opus 4.8/GPT-5.5 这一梯队正面对话的模型。DeepSeek V4 Pro(AA 指数 44)和 GLM-5.2(51)在能力上落后一个明显的身位。但 DeepSeek V4 Pro 的 API 定价约 $1.74/$3.48,仅为 K3 的一半到五分之一。GLM-5.2 的单任务成本仅为 $0.32。
这制造了一个非对称格局:K3 是开源模型的能力天花板,但 DeepSeek 和 GLM 是性价比天花板。对于大多数没有 8×H100 集群的团队而言,调用 DeepSeek V4 Pro 或 GLM-5.2 的 API 远比下载 K3 权重更现实。K3 的「开放」象征意义大于实际部署价值——它证明了开源可以在参数规模和能力上追平闭源前沿,但距离「每个人都能跑」还有很长的距离。
Moonshot 也在模型卡中埋了一个有意思的伏笔:KDA 对传统 prefix caching 构成挑战,团队已经向 vLLM 社区贡献了相应的实现。结合 KDA 加 prefill cache,Moonshot 声称能以极具竞争力的 token 价格服务 K3,尽管其规模与长上下文带来了更高的底层成本。如果这一优化最终被社区验证为有效,它可能改变超大模型服务经济学的基线假设。
目前仍未回答的关键问题包括:Anthropic 在 2026 年 2 月指控 Moonshot 使用 340 万条 Claude 对话进行蒸馏训练,这一争议在权重公开后是否会因可审计而推进或平息?社区对 K3 的独立 benchmark 复现结果何时能够替代 Moonshot 自报的全部数据?MXFP4 QAT 训练在实际部署中的精度退化是否如 Moonshot 所述那样温和?
最后一个问题尤其重要:如果 K3 的量化感知训练确实兑现了「低精度不降智能」的承诺,它定义的将不仅是 K3 自身的部署边界,而是整个下一代超大模型的设计范式——在训练阶段就为推理硬件做优化,而不是等训练完成后再做妥协。