Apertus 并不是 2026 年 6 月发布的新模型。它由 EPFL、ETH Zurich 和瑞士国家超级计算中心(CSCS)共同开发,于 2025 年 9 月 2 日正式开放。近一年后回看,这个项目最值得关注的并非一次新的模型发布,而是它为“全开放”基础模型给出了一套可以检查的工程样本。
“全开放”具体开放了什么
Apertus 首批提供 8B 和 70B 两种规模,均采用 Apache 2.0 许可证。项目不仅公开模型权重,还公布训练代码、数据处理流程、评估工具、中间检查点和训练方法。研究者因此可以检查模型从数据准备到训练的多个环节,而不只是下载最终权重进行推理。
这种开放程度是 Apertus 与许多“开放权重”模型的主要区别。后者通常允许下载权重,但训练数据构成、清洗方法和训练代码未必完整公开。Apertus 团队将可复现和可审计视为项目目标,不过这并不意味着任何第三方都能以相同成本复现 70B 模型;算力、存储和分布式训练工程仍是现实门槛。
多语言训练不是附加功能
技术报告显示,Apertus 使用约 15 万亿个 token 训练,覆盖超过 1,800 种语言,约 40% 的预训练数据为非英语内容。瑞士德语和罗曼什语等在主流大模型语料中相对不足的语言,也被纳入训练范围。
团队公布的评估表明,Apertus 在全开放模型的多语言基准中具有竞争力。这里需要区分两层结论:它证明了公开训练资产与大规模多语言训练可以同时实现,但并不等于它在所有任务上超过闭源或开放权重模型。模型卡和技术报告仍应是具体部署前判断能力与限制的依据。
数据治理被放进训练流程
Apertus 的数据管线只处理公开可访问的数据,并追溯尊重网站的 robots.txt 排除要求,同时过滤非许可内容、有毒内容和个人身份信息。技术报告还说明,团队在预训练中采用 Goldfish 目标,以降低逐字记忆训练文本的风险。
ETH Zurich 的发布说明称,项目开发时考虑了瑞士数据保护法、瑞士版权法以及欧盟《人工智能法案》的透明度义务。更准确的理解是:Apertus 将数据来源、权利人选择和透明度要求落实为可检查的工程措施。它不是监管机构颁发的“合规认证”,也不能替代部署者针对具体用途进行法律和风险评估。
公共机构模型的价值与边界
Apertus 由 Swiss AI Initiative 推动,并使用 CSCS 的 Alps 超级计算机训练;Swisscom 作为战略合作伙伴提供访问渠道。项目把基础模型视为公共研究基础设施:高校、企业和公共部门可以在公开资产上继续微调、审计和开发应用。
它的长期价值取决于后续维护,而不是一次发布。模型是否持续更新、数据流程能否接受外部审查、下游开发者是否真正复用这些资产,都会决定“全开放”能否转化为稳定生态。至少在首个版本中,Apertus 已经把开放从许可证口号推进到数据、代码、检查点和训练方法这一整套可核验材料。