AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

ox-alpha 的“登顶”被夸大了,但匿名上架已成真实发布流程

2026-08-24 / 1 天前 · 共 2,641 字

模型
OrcaRouter

8 月 20 日,OpenRouter 上出现了一个匿名模型 stealth/ox-alpha:104.8 万 token 上下文、131,072 token 输出上限、支持文本/图像/视频输入,一周内免费。随后几天它被传成“在编程评测中超过 GPT-5.6 与 Claude”。这个说法来自独立开发者 Ben Davis 跑的一个 10 题子集,他本人都在原帖里写了“方差可能很大”。更接近事实的判断是:ox-alpha 的“登顶”是被放大的小样本信号;真正值得记录的,是匿名上架这套发布流程——它是半年内第 5 次出现,前 4 次最终全部被中国实验室认领。

“80% 登顶”到底是什么

Ben Davis 在 8 月 21 日把 ox-alpha 跑了一遍 DeepSWE 的 10 个任务,过了 8 个,得 80% Pass@1。他原帖直接写出对比与困惑:gpt-5.6-sol 52%、fable 65%、“whatever the hell this is” 80%,“was a near miss on the ‘x’s so actually over 80%…… I am very confused”。这是社区测试,不是榜单成绩。

几个数字都经不起“登顶”的读法。样本只有 10 题,Davis 自己标注是子集、方差可能很大。对照分数也不是同一批样本:65%(Fable 5)和 62%(GLM-5.3、Grok 4.6)在 10 题上不可能是整数百分比,说明它们来自更大、不同的测试轮次。ox-alpha 也没有进入 Artificial Analysis,公开 DeepSWE 榜单查无此模型,OpenRouter 页面连 benchmark 区块都没有。在另一位创作者的 Kingbench 上,它得 87.5%、排第二——在 GLM-5.3 之后。

更直接的对照来自智谱官方。8 月 14 日 GLM-5.3 发布博客的全量 DeepSWE v1.1 表里,GPT-5.6 Sol 是 72.7、Claude Fable 5 是 69.7、GLM-5.3 是 66.9。也就是说,在完整基准上,被传“被超过”的两个闭源模型反而领先。这当然也是厂商自测口径,但它足以说明“ox-alpha 超过 GPT-5.6”是一个样本与口径都不可比的结论。

指纹证据链,和它的裂缝

支持“智谱 GLM 系”的证据并不弱。Davis 归纳了四条:视频编码器——在四组受控视频上,ox-alpha 的 token 消耗与 GLM-5V-Turbo 完全一致(帧率无关采样、约 147 token/秒的时长缩放、逐帧分辨率缩放),而 MiMo v2.5、Qwen 3.8 Max、GLM-4.6V 明显不同;tokenizer——25 个提示词下 token 数与 GLM-5.3 完全一致,只差一个固定的 +75 隐藏包装;音频拒绝行为与 GLM-5V 一致(而另一候选 MiMo 支持音频);输出风格约每千字 1.3 个 emoji,接近 GLM/Qwen。Davis 把信心标为“99%”,但这是他对自己推断的估计,不是任何一方确认。

还有一处几乎被忽略的旁证:有人对比 OpenRouter 公开 API 元数据,发现 ox-alpha 与 GLM-5.3 的参数面几乎一致——同样的 10 个支持参数、同样默认值(temperature=1、top_p=0.95)、同样的上下文与输出上限、同样“推理强制开启、默认 max”,且两者都缺 structured_outputs,而 GLM-5.2 不是这样。

但证据链并非没有裂缝。有分析者拿出相反的 tokenizer 结论,认为 ox-alpha 用的是 CL100K base,这会排除 OpenAI、Google、Anthropic、xAI 和各中国头部实验室,把线索推向微软 Phi/MAI 一系(IBM Granite 作为遥远的备选);社区里还飘着“未发布 Gemini”的猜测。The Next Web 引述分析人士 Andrew Curran 的话:到周末,人们“比前一晚更不确定任何事”。模型在对话里自称是谁同样不作数,它只会复述训练数据里的标签。

如果是智谱,它只能是“还没发布的那一个”

最尖锐的矛盾在模态。8 月 14 日发布的 GLM-5.3 是纯文本模型,与 GLM-5.2 共用同一 744B base,提升全部来自 post-training,且权重要等安全审查结束、约两周后才放出。ox-alpha 却接受图像和视频输入。所以即便归因成立,它也不是 GLM-5.3 本身,而是一个未发布的多模态兄弟版本——社区口头的“GLM-5.3V”或“GLM-5.5”都是猜测,没有官方命名。这与智谱此前的节奏吻合:GLM-5 当年就是先以匿名 Pony Alpha 上架、约五天后被认领。

匿名上架:半年第 5 次,前 4 次全是中国实验室

ox-alpha 是近六个月里第 5 个匿名上架的模型,前四个无一例外都由中国实验室认领:Pony Alpha(2 月,智谱 GLM-5)、Hunter Alpha(3 月,小米 MiMo-V2-Pro)、Elephant Alpha(4 月,蚂蚁 Lingxi Ling-2.6-flash)、Owl Alpha(4 月末,美团 LongCat-2.0,首个在国产芯片上训练的万亿参数模型)。更早还有 OpenAI 的 Quasar/Optimus Alpha(后为 GPT-4.1)与 xAI 的 Sonoma/Dusk Alpha(后为 Grok 4 Fast)。

这套流程的好处是明确的:去掉品牌光环让开发者只看能力;免费流量带来真实工作负载的压测(OpenCode 称供应方有每天 100 万亿 token 的容量);一周的“这是谁做的”本身就是最便宜的发布预热。ox-alpha 上线第一天就有 Nous Research 的 Hermes Agent 和 Zed 编辑器接入,Stripe CEO Patrick Collison 试后评价“非常 impressive”。

免费的代价:匿名主体与合规真空

OpenRouter 的列表写得很清楚:prompts 和 completions 会被那个不愿具名的 provider 保留,只是“不用于训练”。对一个无法命名的对手方,保留期限、管辖地、数据处理协议、安全姿态都无法审计。对欧洲企业这不止是疑云:GDPR 要求具名处理者,而欧盟 AI Act 的透明度义务已在 8 月 2 日生效,罚则可到 1500 万欧元或全球营收 3%,匿名主体是实打实的 blocker。此外,ox-alpha 没有 SLA、没有下线预告,随时可能消失——此前的匿名模型就曾在被认领时消失。

给从业者的判断很直接:免费一周是测试窗口,不是依赖。拿自己的任务跑它、留好 fallback 链,别把私有代码或客户数据送进一个没有名字的上下文窗口。下一个可观察变量是:免费窗口结束时,是否有实验室站出来认领,以及认领后它落在哪个价格档位。

来源

  1. OpenRouter — Stealth(ox-alpha 上架页) · OpenRouter
  2. GLM-5.3: Frontier Coding with Emergent Cyber Capabilities · Z.ai
  3. Ox Alpha Stealth Model: Who Made It and How to Use It · Codersera
  4. A free AI model is winning over developers. And nobody knows whose servers it runs on · The Next Web
  5. Ox Alpha: The Anonymous Frontier Model That's Free for a Week — and Nobody Will Say Who Made It · OrcaRouter
  6. Anonymous AI Model Tops GPT-5.6 and Claude in Coding Tests; Technical Fingerprint Points to Zhipu's Unreleased GLM Flagship · BigGo Finance
  7. OX Alpha: The Anonymous Frontier Model · Local AI Zone
  8. The State of Open Coding AI Models in August 2026 · Towards AI

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Wccftech 为 Ox Alpha 配的插画:一只机械公牛站在科技实验室场景中,屏幕上显示「OX ALPHA: A STORY OF ARTIFICIAL AWAKENING」

    匿名模型 Ox Alpha 上线:stealth 发布正在成为中国实验室的发布前测试

    算法 · 2026-08-23

  • Tom's Hardware 报道中使用的 Claude 品牌配图

    Anthropic 的「AI 加速 AI」论证:80% 代码为据,递归自我改进仍是推测

    算法 · 2026-08-25

  • Anthropic 透明中心(Transparency Hub)页面题图

    Anthropic 上调 misalignment 风险评级,并自曝生物分类器缺位近一年

    算法 · 2026-08-25

  • 多台彩色人形机器人在北京国家速滑馆开幕式前整齐列阵

    百米 9.39 秒、跳高 2.88 米:人形机器人「破纪录」背后是评测方式之变

    算法 · 2026-08-24

  • 示意图:Codex 通过 Chrome DevTools 驱动应用验证自己的工作——选择目标、快照界面状态、触发操作、观察运行时事件、应用修复并循环重跑,展示 Harness 管理的执行循环。

    OpenAI 开源 Codex Harness:智能体的护城河正从权重转向脚手架

    算法 · 2026-08-24

  • 一台人形机器人参赛者于 8 月 19 日在北京国家速滑馆进行第二届世界人形机器人运动会赛前测试

    跑得比博尔特快、却撞上电箱:人形机器人运动会的自主化考题

    算法 · 2026-08-22

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS