7 月 19 日深夜,月之暗面 Kimi 团队发布了一则措辞罕见的公告:因「始料未及的算力挑战」,即日起暂停 C 端新用户订阅,将全部算力优先保障已订阅用户。
此时距离 Kimi K3 的正式上线——7 月 16 日——仅过去三天。这个拥有 2.8 万亿参数、在 Frontend Code Arena 登顶的模型,用 72 小时完成了从「中国 AI 里程碑」到「算力天花板受害者」的身份切换。
公告原文提供了足够坦诚的细节:「过去 48 小时,用户请求量已大幅超出我们的预估,并且逼近现有集群的承载极限。」公司同时宣布正在全速推进算力扩容,将「逐步开放更多订阅名额直至全面恢复正常订阅」。但恢复时间未定。
公告里的两层机制
暂停并非一刀切。月之暗面将现有订阅用户划分为两个 tier:已订阅用户权益不受影响;新注册用户以「批次」方式逐步开放,具体节奏取决于算力扩容进度。
这种分层是务实的损伤控制——在无法服务所有人的情况下,优先保护已付费用户的体验,同时不彻底关上新用户的大门。The Verge 引述知情人士称,K3 在前 48 小时内的新注册量已达到公司预估峰值的「数倍」。
CEO 杨植麟在声明中将这一状况定性为「远超预期,已逼近当前算力上限」。对于一家估值 200 亿美元、刚在 NVIDIA GTC 2026 上高调发布旗舰模型的公司来说,这既是值得炫耀的「烦恼」,也是真实存在的物理约束。
开源悖论:权重免费,算力不是
Kimi K3 的核心承诺之一是 MIT 许可证下的开源权重——理论上,任何组织都可以下载模型并在自己的硬件上运行。月之暗面已将正式开源日期定在 7 月 27 日。
但暂停事件暴露了一个残酷的等式:开源权重 ≠ 免费算力。
即使是创造者自己,集中了最了解 K3 架构的工程师、最适配的推理优化和所有可调度的 GPU 集群,也只能撑住三天。对于任何想要「自己部署」的第三方组织,推理一个 2.8 万亿参数的 MoE 模型意味着数百 GB 的显存需求和精心设计的分布式推理管线——这不是下载一个文件就能跑起来的工作量。
模型的民主化正在经历一次关键转向。过去两年的叙事是「模型越来越强,开源越来越近」,瓶颈在模型能力。K3 证明模型能力已经达标,但瓶颈转移到了另一个更物理、更难绕过的地方:谁有足够的 GPU。
基础设施鸿沟:不是模型差距,是云差距
将 K3 的处境与美国同行对比,差距的维度就会变得清晰。
OpenAI 的 GPT-5.6 和 Anthropic 的 Claude Fable 5 可以面向数亿用户平滑扩展,背后是 Microsoft Azure 和 AWS 的全球云基础设施。当 Kimi K3 在数十万用户级别就触达极限时,这不是模型能力的差距——在 Artificial Analysis 基准上 K3 与 Fable 5 的差距仅有不到 3 个百分点——这是云计算基础设施的差距。
Bank of America 分析师在 7 月 17 日的报告中指出,尽管中国 AI 面临「持续存在的硬件和算力约束」,K3 仍然证明了「预训练扩展配合架构创新可以在旗舰中国模型上实现阶梯式增益」。但模型能做到的,基础设施不一定能同步跟上。
Moor Insights & Strategy 首席分析师 Patrick Moorhead 则将市场反应比作「与 DeepSeek 恐慌惊人相似」,认为 K3 最终将加速而非缩小推理市场。这个判断有其道理,但它回避了前置条件:推理市场的增长需要一个前提——足够的推理芯片。
不是孤例:中国开源模型的集体困境
K3 的算力瓶颈并非孤例。
据用户报告和社区讨论,DeepSeek V4 同样面临排队等待问题。AI 通讯作者 Nathan Lambert 在 Interconnects 上写道:「GLM 也曾经选择性决定优先服务谁;我相当确定 DeepSeek 也有这个约束。」
这不是某一个模型的失败,而是中国顶级 AI 实验室的系统性困境:当模型能力终于追上闭源前沿,支撑其大规模服务的物理基础设施却尚未同步到位。用 The Decoder 的话说,K3 正在「迫使西方 AI 实验室质疑他们的算力优势」——但反过来看,这句话本身就承认了一个前提:算力优势到目前为止仍然在西方。
加上北京正在考虑限制中国 AI 模型海外访问的传闻,中国开源模型正面临一种「内外夹击」的处境:对内,算力不足以服务现有需求;对外,监管可能进一步压缩用户覆盖面。
这不只是 Kimi 的问题
暂停订阅的讽刺之处在于,它恰恰是 K3 成功的证明——如果没有人想要,就不需要暂停。
但这也引出一个 K3 自己无法单独回答的问题:如果中国最热门的开源模型连自己的 C 端用户都服务不了,谁来承担全球部署的算力成本?
Moonshot 正在寻求新一轮融资,Business Standard 报道其 IPO 准备工作与暂停公告几乎同步推进。这并不矛盾——融资本身就是为了解决算力扩容的资本需求。但资本市场的耐心和 GPU 的物理交付周期之间存在一个不可压缩的时间差。
7 月 27 日的开源权重发布将成为一个检验节点。届时,拥有自有 GPU 集群的组织可以自行部署 K3,绕过 Moonshot 的订阅瓶颈。但这不仅不会解决「谁来承担算力成本」的问题,反而将其从月之暗面的资产负债表转移到了每一个部署者的电费和 GPU 折旧上。
Kimi K3 的故事至此形成了一条完整的弧线:一个技术上足以挑战闭源前沿的模型,在上线三天后因为太受欢迎而不得不暂停服务,而它即将通过开源权重把同样的算力压力分发给任何想部署它的人。这不是一个关于失败的叙事,而是一个关于成功的代价正在从「模型研发」转向「物理基础设施」的清晰信号。