8 月 20 日,一个名为「Ox Alpha」的模型以匿名身份同时出现在模型路由平台 OpenRouter 与开源终端编程智能体 OpenCode 上:104.8 万 token 的上下文窗口、接受文本/图片/视频输入、预览期内输入与输出 token 全部免费。OpenCode 在公告里给出的容量承诺是「每天 100 万亿 token」——约合每秒 11.6 亿 token。这个数字若按字面理解,足以让运营方跻身全球最大推理服务商之列(OrcaRouter),却没有公司站出来认领。
真正值得注意的不是「又出了一个神秘模型」,而是这套玩法的成熟度。Ox Alpha 是六个月内第五次「stealth」(匿名)发布;据 Coursiv 与 OrcaRouter 的整理,此前四次——智谱的 GLM-5、小米的 MiMo-V2-Pro、蚂蚁集团的 Ling-2.6-flash、美团的 LongCat-2.0——都在数天到数周后由中国实验室认领。匿名投放正从偶然事件变成一种标准动作:在正式发布前测试与造势。
匿名投放如何变成一条流水线
stealth 发布的核心,是把「官方发布会」替换成「匿名投放+免费压测」。OpenRouter 的 stealth 页面写得很清楚:Ox Alpha「由一家选择在预览期保持匿名的第三方 provider 开发与运营」,OpenRouter 只负责路由请求,「不是它的开发者、所有者或 provider」。
对实验室而言,这套玩法一次解决三件事。其一是无品牌偏见的反馈:测试者无法把对某个品牌的既有预期带进评测,反馈更接近真实能力。其二是真实流量的基础设施压测:据 Coursiv 记录,Claude Code、Hermes Agent 等编码 harness 几乎在第一时间就向它灌入合计约 180 亿 token,这比任何内部 benchmark 都更能暴露并发与稳定性问题。其三是免费造势:一个能打赢知名竞品的「神秘模型」带来的讨论,是广告买不来的。
「80% 超越 Fable 与 GPT-5.6」来自 10 道题,不是榜单
Ox Alpha 传播最广的数字是一个 benchmark 结果:在软件工程评测 DeepSWE 上拿到 80% 以上,超过 Claude Fable 的约 65% 与 GPT-5.6 Sol 的约 52%。
这个数字需要降格看待。它来自开发者 Ben Davis 的一个 10 题用户测试;DeepSWE 官方版本包含 113 道从 91 个活跃开源仓库现写的长时程工程题,专门保证参考解不会泄漏进训练数据。手工挑 10 题,完全可能因选题偏好让某个模型占优。截至撰稿时,Ox Alpha 没有在任何主流独立榜单上留下公开成绩。
另一个流传的数字——Kingbench 上 87.5%、位列第二、仅次于 GLM-5.3 的 91.25%——同样来自 Kingbench 创作者本人的自测。更接近事实的表述是:Ox Alpha 在一个小样本、一项个人自测里表现亮眼,仅此而已。
真实使用反馈是混合的。有开发者说它在一个 Python 项目里找到两个其他审计工具漏掉的真实 bug,有人夸它做前端快、能照着截图工作;也有人报告它「思考 40 分钟不产出任何动作」、在复杂后端项目里表现不稳,还有人在同题对比里看到 GPT-5.6 Sol 干净利落地胜出。
指纹鉴定:tokenizer、错误码与「思考太久」的破绽
匿名不等于不可追踪。模型身份会通过 tokenizer、错误码、后端日志语言这些「指纹」泄漏,社区在过去几天把它变成了一场实时侦探游戏。
指向智谱 GLM 的证据最强。据 Coursiv 汇总:tokenizer 与 GLM 家族匹配;后端返回中文错误信息;API 错误码 1210 此前与 Z.ai 关联;速度与缓存模式也相似。一个关键矛盾点是,公开的 GLM-5.3 只支持文本输入,而 Ox Alpha 接受图片与视频——若 GLM 理论成立,这将是尚未发布的多模态变体。
但结论并未闭合。Wccftech 的更新引述另一路分析:有人按 tokenizer 判定 Ox Alpha 用的是 OpenAI 的 cl100k_base 分词器,这恰恰会排除 OpenAI、Google、Anthropic、xAI 以及「所有中国前沿实验室」,唯一吻合的是微软 Phi/MAI 谱系。Coursiv 列的候选名单里还有小米 MiMo V3、腾讯 Hy4、MiniMax,甚至「一个在多模型间切换的路由器」。Hacker News 上的开发者用一句玩笑概括:「思考个没完 = GLM」。
到撰稿时为止,没有公司认领,所有指向都停留在非官方的指纹推断。
「零留存」与「provider 留存」:匿名模型的数据风险
这次发布的条款里有一处口径冲突,值得每个想趁免费窗口试用的开发者看清。
OpenCode 的公告写的是「Zero Data Retention」(零数据留存)。OpenRouter 的 stealth 页面写的却是另一回事:prompt 与 completion「由 provider 留存,但不会用于训练」。到底适用哪条,取决于你从哪里接入;而 provider 是谁、如何存储、留存多久,都没有披露。
这意味着免费试用的对价,可能是把输入与补全交给一家不肯透露姓名的公司。OrcaRouter 的判断更直接:每天 100 万亿 token 与其说是规格参数,不如说是一次压测挑战;匿名发布正是实验室获取「前沿量级真实流量」的方式。测试者实际上在免费替实验室跑评估程序。
边界:接下来看什么
这个故事里成立的事实只有两层:Ox Alpha 确实上线、确实匿名,规格与免费条款有据可查;以及「六个月内五次 stealth、前四次均由中国实验室认领」这条时间线。没有成立的是:它到底是谁做的、真实水平多高、免费期何时结束。
如果历史重演,答案大概率在免费窗口结束时揭晓——预览期约一周、没有公布的确切截止日,多个评测者预估在 8 月底前后。届时伴随的将是正式命名、公开 benchmark 与定价。据 Coursiv 观察,此前 stealth 模型的另一个规律是:免费预览最终都转化成激进便宜的公开价格,这正是中国实验室今年以来持续挤压西方竞品定价的方式。一个「前沿级编码能力、远低于前沿价格」的模型若兑现,其涟漪会远远超出这一个匿名代号。