7 月 23 日,韩国 AI 公司 Upstage 在 HuggingFace 上发布了 Solar Open 2 的权重——一个 250B 参数的 Mixture-of-Experts 模型,每个 token 仅激活 15B 参数,支持 100 万 token 上下文,量化后 2 张 H200 即可运行。两天后,韩国总统李在明在旧金山召集了 Jensen Huang、Sam Altman 和 Dario Amodei,宣布了 Nvidia 与 SK Group 规模超 5000 亿美元的 AI 合作计划。这两件事的共同背景是一项被称为"Dokpamo"(独立基础模型)的韩国政府项目。
Solar Open 2 不是另一个高分通用模型。Upstage 的官方说法是,它被"设计并训练为真实工作环境中 Agent 的基础模型"。这不是营销措辞——模型卡和 50 页技术报告公开了架构决策、训练数据构成和基准测试条件,每一项都指向同一个结论:这是全球主权 AI 竞赛中第一个从架构层面以 Agent 工作负载为核心设计目标的开放权重模型。
架构:把 Agent 的成本写进设计约束
Solar Open 2 的架构有两个关键选择直接回应了 Agent 场景的核心矛盾:任务越长越复杂,模型调用次数越多,推理成本越高。
第一是 Hybrid-Attention MoE。48 层 Transformer 中,模式为 [Softmax, Linear×3] × 12:每 4 层一组,1 层标准 softmax 注意力加 3 层线性注意力。这意味着 75% 的层使用线性注意力,序列信息被编码到固定大小的循环状态中,不需要为每一层维护随上下文线性增长的 KV cache。最终只有 12 层保留 KV cache,长上下文内存开销约为全 softmax 架构的四分之一。
第二是 320 路由专家 + 1 共享专家的 FFN 设计,每 token 选 8 个路由专家。总参数 250B,活跃参数 15B,推理效率直接对应 Agent 的运营成本。Upstage CEO Kim Sung-hun 在 7 月 22 日的开发者活动上对比:"有些最近发布的模型需要 16 张 B200,Solar Open 2 设计目标就是 2 张。"
这种设计还带来了训练层面的收益。Upstage 在技术报告中给出了一个对比实验:Solar Open 2 架构在训练 210B tokens 后达到的 MMLU 性能,全 softmax 的 Solar Open 100B 架构需要 671B tokens 才能达到——训练效率提升超过 3 倍。
线性注意力层的另一个副产品是位置编码的彻底移除(NoPE)。因为没有 RoPE 的外推限制,100 万 token 的上下文窗口不需要额外工程技巧。这对需要同时处理代码库、多份文档和历史搜索结果的 Agent 场景来说不是加分项,而是硬需求。
模型还使用了 Upstage 自研的 Selective Weight Transfer 方法:从上一代 Solar Open 100B 中只迁移架构兼容的 2.3% 权重作为初始化,其余随机。在一个 200B-A15B 的代理实验中,该方法用约 58% 的 tokens 达到了随机初始化相同的训练损失。
基准:四个关键数字
Solar Open 2 的基准数据来自 Upstage 官方技术报告。以下是与同组开放权重模型的对比(数据截至 7 月 23 日 HuggingFace 模型卡):
MMLU-Pro(综合知识):Solar Open 2 得分 86.2,高于 DeepSeek V4 Flash(85.9)、MiMo-V2.5(84.6)和 Mistral Medium 3.5(81.2)。同为 MoE 架构的 Command A+ 得分 79.0。
LiveCodeBench v6(编程):92.4,以 0.1 分领先 DeepSeek V4 Flash(92.3),显著高于 Command A+(86.1)和 Solar Open 100B(56.5)。
IFBench(指令遵循)和 MCP-Atlas(工具调用):这两个 Agent 核心基准上,Solar Open 2 分别得分 80.0 和 58.2,与 DeepSeek V4 Flash 的 80.3 和 58.2 基本持平,同组最高。
APEX-Agents(真实工作 Agent 综合评估):16.6,高于 DeepSeek V4 Flash(13.2)和 MiMo-V2.5(13.4),同组最高。这个基准测试的是多应用协调完成任务的能力,是目前最接近"真实 Agent 工作"的公开评估之一。
最有说服力的数据出现在 Ko-GDPval——一个评估 Agent 在真实工作场景(覆盖律师、会计师、感染控制专员等 58 个职业的 170 个场景)中输出可交付成果的基准。Solar Open 2 得分 86.8,仅落后 DeepSeek V4 Pro(1.6T 参数)0.16 分,领先 MiMo-V2.5-Pro(1T 级参数,84.6)。以活跃参数计算,Solar Open 2 用约三分之一的算力完成了同等质量的工作。
需要注意的是,上述基准数据全部来自 Upstage 自报。IFBench 和 MCP-Atlas 有公开第三方排行榜可供交叉验证,但 Ko-GDPval 和部分韩语基准为 Upstage 自建,跨语言可比性有限。基准设计是否存在有利于特定架构的偏差,需要独立评测回答。
竞争:5 进 3 的淘汰赛与"主权"的定义之争
韩国科学技术信息通信部(MSIT)在 2025 年 7 月启动了"主权 AI 基础模型"项目,目标是摆脱对海外模型的依赖,将韩国推入全球 AI 前三。5 支"精英团队"入选:Naver Cloud、Upstage、SK Telecom、NC AI 和 LG AI Research。
经过 5 个月竞争,今年 1 月 MSIT 公布了第一阶段评估结果。评估分为三块:基准测试(40 分)、10 人专家委员会评审(35 分)、49 名 AI 创业者用户评测(25 分)。LG AI Research 以总分 90.2(满分 100)排名第一,SK Telecom 和 Upstage 随后晋级。Naver Cloud 和 NC AI 被淘汰。
Naver Cloud 的出局比晋级名单更有信息量。MSIT 在公告中给出了明确理由:该项目定义的"主权 AI 基础模型"必须是"国内设计并从头预训练的模型",不允许通过微调海外模型实现。Naver Cloud 的 HyperCLOVA X 模型使用了阿里巴巴 Qwen 的视觉和音频编码器及预训练权重。专家委员会认定,这不符合"主权 AI"的技术原创性标准。
争议并未就此结束。项目初期,Upstage 的 Solar-Open-100B 被指控重用了中国公司的推理代码,SKT 的 A.X K1 也被指与 DeepSeek 模型相似。两家公司的辩护逻辑一致:推理代码(inference code)与训练代码(training code)是两回事,使用开源推理代码运行自家训练的模型,不影响模型原创性。
这场争议背后是一个更根本的问题:在开源 AI 成为全球生态标准的当下,"主权 AI"的边界究竟在哪里?MSIT 的选择暗示了一种答案:权重必须是自己从头训练的,但推理基础设施可以使用开源组件。Naver Cloud 的处境则说明,一旦涉及海外模型的预训练权重,边界线就清晰了。
MSIT 原计划选出 4 支队伍进入第二阶段,目前空缺 1 席,已宣布将在 2026 年上半年重新开放申请。但 Naver Cloud 和 NC AI 都表示不会参与"复活赛",Kakao 也无兴趣。截止目前,第四席无人认领。
落地:Daum 是韩国的第一块 Agent 试验田
Upstage 已宣布将 Solar Open 2 部署到韩国门户 Daum(由 AXZ 运营,周活跃用户超千万),从搜索和摘要扩展到对话式 Agent 服务。同时,面向地方政府的 AI Agent 平台 Timely 也将接入 Solar Open 2。
这可能是韩国普通用户第一次大规模接触 AI Agent。Daum 在韩国互联网的日常渗透率意味着测试的规模和反馈密度远高于封闭的企业部署。如果 Solar Open 2 在 Daum 的 Agent 服务中出现可靠性问题——比如工具调用失败率高于展示、多轮对话中的遗忘或误操作——信息传播的速度也会同样快。
Upstage 还宣布将在金融、法律和医疗领域与国内 NPU 芯片结合,构建端到端的国产 AI 基础设施。FuriosaAI 的 NPU 已被确认参与 Daum 的 AI 搜索栈。这透露了韩国主权 AI 的深层战略:不仅模型要自主,推理芯片也要自主。
主权 AI 竞赛,下一项考核是"干活"
Solar Open 2 的出现与同一天发生的另一条新闻形成对照:7 月 25 日,李在明总统在旧金山召集全球科技 CEO,Nvidia 与 SK Group 宣布 5000 亿美元以上规模的 AI 数据中心计划,首座 2GW 数据中心由 Vera Rubin 芯片和 HBM4 内存驱动,预计 2027 年上线。
这条新闻说明韩国主权 AI 战略的硬件层正在以超大规模推进——从 HBM 内存(SK Hynix)到数据中心再到 Foundry(三星),韩国在 AI 供应链上的位置独一无二。但硬件优势并不会自动转化为模型和产品优势。Solar Open 2 的价值就在于它是这条链条上缺失的软件环节的一次可验证交付。
在全球主权 AI 版图中,欧洲的 Mistral 走的是通用高性能路线,中东的 Falcon 依赖石油资本但生态薄弱,中国的 DeepSeek 以极致性价比撬动全球开源社区。Solar Open 2 的差异化在于它把"Agent 可用性"作为第一设计目标——不仅能在基准上跑分,还要以合理的推理成本在真实工作环境中反复调用。这是一个更窄但更具体的命题。
未能回答的问题同样重要:Agent 基准的第三方独立评测何时出现?Daum 部署后的实际用户反馈如何?第四支队伍能否找到,又会是谁?Upstage 能否在第二阶段保持与 LG AI Research 和 SK Telecom 的竞争力?这些变量的答案将在 2026 年下半年逐渐浮出。眼下可以确定的是,主权 AI 的叙事已经从"能不能做基础模型"升级为"能不能让模型真正干活"。

