AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

匿名模型 Ox Alpha 上线:stealth 发布正在成为中国实验室的发布前测试

今天 · 共 2,458 字

模型
Wccftech

8 月 20 日,一个名为「Ox Alpha」的模型以匿名身份同时出现在模型路由平台 OpenRouter 与开源终端编程智能体 OpenCode 上:104.8 万 token 的上下文窗口、接受文本/图片/视频输入、预览期内输入与输出 token 全部免费。OpenCode 在公告里给出的容量承诺是「每天 100 万亿 token」——约合每秒 11.6 亿 token。这个数字若按字面理解,足以让运营方跻身全球最大推理服务商之列(OrcaRouter),却没有公司站出来认领。

真正值得注意的不是「又出了一个神秘模型」,而是这套玩法的成熟度。Ox Alpha 是六个月内第五次「stealth」(匿名)发布;据 Coursiv 与 OrcaRouter 的整理,此前四次——智谱的 GLM-5、小米的 MiMo-V2-Pro、蚂蚁集团的 Ling-2.6-flash、美团的 LongCat-2.0——都在数天到数周后由中国实验室认领。匿名投放正从偶然事件变成一种标准动作:在正式发布前测试与造势。

匿名投放如何变成一条流水线

stealth 发布的核心,是把「官方发布会」替换成「匿名投放+免费压测」。OpenRouter 的 stealth 页面写得很清楚:Ox Alpha「由一家选择在预览期保持匿名的第三方 provider 开发与运营」,OpenRouter 只负责路由请求,「不是它的开发者、所有者或 provider」。

对实验室而言,这套玩法一次解决三件事。其一是无品牌偏见的反馈:测试者无法把对某个品牌的既有预期带进评测,反馈更接近真实能力。其二是真实流量的基础设施压测:据 Coursiv 记录,Claude Code、Hermes Agent 等编码 harness 几乎在第一时间就向它灌入合计约 180 亿 token,这比任何内部 benchmark 都更能暴露并发与稳定性问题。其三是免费造势:一个能打赢知名竞品的「神秘模型」带来的讨论,是广告买不来的。

「80% 超越 Fable 与 GPT-5.6」来自 10 道题,不是榜单

Ox Alpha 传播最广的数字是一个 benchmark 结果:在软件工程评测 DeepSWE 上拿到 80% 以上,超过 Claude Fable 的约 65% 与 GPT-5.6 Sol 的约 52%。

这个数字需要降格看待。它来自开发者 Ben Davis 的一个 10 题用户测试;DeepSWE 官方版本包含 113 道从 91 个活跃开源仓库现写的长时程工程题,专门保证参考解不会泄漏进训练数据。手工挑 10 题,完全可能因选题偏好让某个模型占优。截至撰稿时,Ox Alpha 没有在任何主流独立榜单上留下公开成绩。

另一个流传的数字——Kingbench 上 87.5%、位列第二、仅次于 GLM-5.3 的 91.25%——同样来自 Kingbench 创作者本人的自测。更接近事实的表述是:Ox Alpha 在一个小样本、一项个人自测里表现亮眼,仅此而已。

真实使用反馈是混合的。有开发者说它在一个 Python 项目里找到两个其他审计工具漏掉的真实 bug,有人夸它做前端快、能照着截图工作;也有人报告它「思考 40 分钟不产出任何动作」、在复杂后端项目里表现不稳,还有人在同题对比里看到 GPT-5.6 Sol 干净利落地胜出。

指纹鉴定:tokenizer、错误码与「思考太久」的破绽

匿名不等于不可追踪。模型身份会通过 tokenizer、错误码、后端日志语言这些「指纹」泄漏,社区在过去几天把它变成了一场实时侦探游戏。

指向智谱 GLM 的证据最强。据 Coursiv 汇总:tokenizer 与 GLM 家族匹配;后端返回中文错误信息;API 错误码 1210 此前与 Z.ai 关联;速度与缓存模式也相似。一个关键矛盾点是,公开的 GLM-5.3 只支持文本输入,而 Ox Alpha 接受图片与视频——若 GLM 理论成立,这将是尚未发布的多模态变体。

但结论并未闭合。Wccftech 的更新引述另一路分析:有人按 tokenizer 判定 Ox Alpha 用的是 OpenAI 的 cl100k_base 分词器,这恰恰会排除 OpenAI、Google、Anthropic、xAI 以及「所有中国前沿实验室」,唯一吻合的是微软 Phi/MAI 谱系。Coursiv 列的候选名单里还有小米 MiMo V3、腾讯 Hy4、MiniMax,甚至「一个在多模型间切换的路由器」。Hacker News 上的开发者用一句玩笑概括:「思考个没完 = GLM」。

到撰稿时为止,没有公司认领,所有指向都停留在非官方的指纹推断。

「零留存」与「provider 留存」:匿名模型的数据风险

这次发布的条款里有一处口径冲突,值得每个想趁免费窗口试用的开发者看清。

OpenCode 的公告写的是「Zero Data Retention」(零数据留存)。OpenRouter 的 stealth 页面写的却是另一回事:prompt 与 completion「由 provider 留存,但不会用于训练」。到底适用哪条,取决于你从哪里接入;而 provider 是谁、如何存储、留存多久,都没有披露。

这意味着免费试用的对价,可能是把输入与补全交给一家不肯透露姓名的公司。OrcaRouter 的判断更直接:每天 100 万亿 token 与其说是规格参数,不如说是一次压测挑战;匿名发布正是实验室获取「前沿量级真实流量」的方式。测试者实际上在免费替实验室跑评估程序。

边界:接下来看什么

这个故事里成立的事实只有两层:Ox Alpha 确实上线、确实匿名,规格与免费条款有据可查;以及「六个月内五次 stealth、前四次均由中国实验室认领」这条时间线。没有成立的是:它到底是谁做的、真实水平多高、免费期何时结束。

如果历史重演,答案大概率在免费窗口结束时揭晓——预览期约一周、没有公布的确切截止日,多个评测者预估在 8 月底前后。届时伴随的将是正式命名、公开 benchmark 与定价。据 Coursiv 观察,此前 stealth 模型的另一个规律是:免费预览最终都转化成激进便宜的公开价格,这正是中国实验室今年以来持续挤压西方竞品定价的方式。一个「前沿级编码能力、远低于前沿价格」的模型若兑现,其涟漪会远远超出这一个匿名代号。

来源

  1. OpenRouter Stealth — Ox Alpha · OpenRouter
  2. Ox Alpha: The Mystery AI Model You Can Try Free This Week · Coursiv
  3. Ox Alpha: who's behind the free mystery frontier model? · OrcaRouter
  4. A Mysterious AI Lab Is Offering 100 Trillion Free Tokens/Day For Its Ox Alpha Model · Wccftech

评论

登录后即可参与评论。

加载评论中…

相关文章

  • 论文图 1:AutoResearch 轨迹的生成与执行成本随规模非对称增长——生成通过批处理共享算力,执行则每个方案独占一个沙箱与真实机时,使执行成为传统 RL 的瓶颈;WMRL 用世界模型移除该瓶颈

    用世界模型替代环境执行,Agent RL 提速 3–4 倍且性能不降反升

    算法 · 2026-08-15

  • 一台人形机器人参赛者于 8 月 19 日在北京国家速滑馆进行第二届世界人形机器人运动会赛前测试

    跑得比博尔特快、却撞上电箱:人形机器人运动会的自主化考题

    算法 · 2026-08-22

  • 西门子在 CES 2024 消费电子展的展台

    五部门警告:黑客正用 AI 生成的漏洞脚本攻击美国关键基础设施

    算法 · 2026-08-22

  • ARC-AGI-3 交互推理基准中一个游戏的起始画面

    Nvidia AVO 让 Opus 5 在 ARC-AGI-3 满分:长程任务的关键变量是 harness

    算法 · 2026-08-21

  • Cursor 应用图标在 macOS Dock 上的特写

    Cursor 发布 Origin 代码托管平台:把「存代码」也收进 AI 编码栈

    算法 · 2026-08-21

  • 冷冻电镜重构:一个由基因组语言模型设计出的功能性噬菌体颗粒

    Evo 2 首次生成 16 个可用噬菌体:'从零设计'的真实增量与边界

    算法 · 2026-08-19

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS