AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Nemotron 3.5 Lightning 发布:路由库 Switchyard 才是 NVIDIA 的真正赌注

2026-08-12 / 2 天前 · 共 3,990 字

模型Agent
NVIDIA Developer Blog

NVIDIA 在 8 月 11 日同时发布了两样东西:一个模型,和一个路由器。模型是 Nemotron 3.5 Lightning——30B MoE 架构、3B 活跃参数、专为 Agent 高频执行任务优化。路由器是 NeMo Switchyard——一个开源 Rust 库,负责在每个 Agent 工作流步骤中把请求导向最合适的模型。

同一天,十家合作伙伴公布了部署数据。但这些数字几乎都在描述路由器的效果,而不是模型本身。NVIDIA 副总裁 Kari Briski 用了大量篇幅介绍模型的可定制性,但 Futurum Group 分析师 Nick Patience 的判断更直接:"两个产品中,路由库的战略分量更重。"

这是理解此次发布的关键。模型是可见的弹药,但 NVIDIA 真正押注的,是那个在每一轮 Agent 调用中决定"哪个模型上"的决策层。它比任何单次模型发布都更难替换。

Lightning:快,但知道自己不是最聪明的那个

Nemotron 3.5 Lightning 是 Nemotron 3 家族中最小的成员,基于 Hybrid Mamba-Transformer 架构,31.6B 总参数中每次推理仅激活约 3.6B。它从 Nemotron 3 Ultra 蒸馏而来,开发周期约六周。

在 Artificial Analysis 综合智能指数上,Lightning 得分 24。排名表顶端是 Claude Opus 5 的 61-63 分。同一家族的 Nemotron 3 Super 得 26 分,Qwen3.6 35B 得 32 分,Meta 前一天刚发布的 Muse Glimmer 得 35 分。Lightning 的智力不是卖点,NVIDIA 也无意让它在推理能力上与 frontier 模型正面竞争。

NVIDIA 的论点是:Agent 日常工作中,需要"思考"的步骤只占一小部分。大部分调用是工具执行、结果验证、格式化输出——这些任务不需要 Claude Opus 5 的推理能力,但需要够快的吞吐和够低的成本。Lightning 的定位正是这个执行层。它在 Artificial Analysis 上的 Time per Intelligence Index Task 仅约 0.5 分钟,而 Qwen3.6 35B A3B 需要约 3.5 分钟。通过 DeepInfra 的 NVFP4 endpoint,输出速度达到近 670 tokens/秒。

不过,闭源模型在时间效率上仍有优势。Gemini 3.5 Flash-Lite 智力 37 分、完成速度相近;GPT-5.6 Luna 智力 52 分、任务完成不到 2 分钟。Lightning 在 open-weight 赛道里领先的是"智力/速度帕累托前沿"——在低智力等级中跑得最快——而不是绝对的智力或效率。

Agent 能力方面,由 GDPval-AA v2(代理任务)和 Terminal-Bench v2.1(终端操作)衡量,Lightning 较前代 Nano 有显著提升:前者 ELO 从 Nano 的约 490 跃升至 824,超过了 Nemotron 3 Super 和 OpenAI 的 gpt-oss-120b;后者从 7% 提升至 24%。

Switchyard:预发布标签下的生产级数据

NeMo Switchyard 是一个 Rust 代理和库,核心工作很简练:它坐在客户端和模型后端之间,把每个请求解码为 provider-neutral 格式后按策略路由,再编码为目标模型的格式发出去。它支持 OpenAI Chat、Anthropic Messages 和 OpenAI Responses 三种协议的双向转换,这意味着 Claude Code、Codex、OpenClaw 等工具可以在不修改代码的情况下,由 Switchyard 将请求透明地分发到不同模型。

路由策略从最简单的随机选择一直延伸到基于分类器的信号驱动阶段路由。开发者可以自定义路由算法,按质量、延迟、成本或领域需求配置。

值得注意的是 Switchyard 的分布策略。NVIDIA 没有与 OpenRouter、LiteLLM、Kong 等现有网关正面开战,而是让它们把 Switchyard 直接嵌入自己的产品。Kong 将 Switchyard 原生集成到 Kong AI Gateway;LiteLLM 将其作为插件加入代理层;OpenRouter 将其作为路由目标。

这个选择的后果是双重的:NVIDIA 在第一天就获得了分发覆盖,而网关产品之间的差异化则逐步向可观测性、计费和访问控制收窄——"模型该走哪条路"这一层被 Switchyard 标准化了。

合作方数据解读:好看,但要看仔细

NVIDIA 公布的合作伙伴数据集中在路由效率上,而非模型能力。关键数字:

LangChain 在 145 个多轮 Deep Agents 任务中,通过 Switchyard 将仅 7% 的调用路由到 frontier 模型,整体成本降低 74%,准确率下降约 6 个百分点。接近全部的节省来自第一次模型替换——从"全用 Opus 4.8"切换到"Opus + Lightning"。

Ramp 在自有的 SWE-Bench 测试套件中,成本降低 58%、运行时间降低 33%,同时匹配 frontier 模型的性能水平。Cognition 将 Switchyard 的 staged router 集成到 Devin Desktop(供 NVIDIA 内部使用),在 FrontierCode Main 上实现接近 frontier 的准确率,平均成本降低 28%。Boomi 达到 100% 的领域路由准确率,将 59% 流量导向经过微调的小模型,延迟降低 21%。

CodeRabbit 用 NVIDIA 的标准 AutoModel recipe 训练了一个 epoch,花费 85 美元、两小时,将代码审查路由器的准确率提升了 34 个百分点。CrowdStrike 的 benign recall 提升了 45 个百分点。Harvey 在法律任务完成率上提升了 8.3 个百分点。

所有这些数据都有同一个前提:它们来自 NVIDIA 精心挑选的早期接入合作伙伴——这些团队拥有深厚的 ML 工程能力。Futurum Group 指出,对"只有一个数据团队、没有研究职能的组织"来说,定制化效果可能完全不同。

另外,成本对比的基线值得注意。NVIDIA 的核心声称是"以约三分之一的成本维持 frontier 级准确率",对比对象是"为每一步调用都使用 Opus 4.8"。在实际生产中,任何注重成本的团队都已经在使用更便宜的模型处理执行层任务。真正有价值的问题不是"比全用 Opus 便宜多少",而是"路由层的引入带来了多少额外节省"——NVIDIA 自己的数据显示,从 Opus+Lightning 双模型池到再加入两个开源模型,成本从约 95 美元降至约 72 美元,任务完成度几乎没有变化。边际收益在第一个替代之后就急剧收窄。

硬件闭环:路由器决定谁跑在谁的芯片上

理解 Switchyard 不能只看路由逻辑,还要看 NVIDIA 为什么要开源它。Futurum Group 分析师的判断直截了当:"谁控制模型选择,谁就控制哪块硅片服务哪些 token。NVIDIA 正在把这个能力免费送出去。"

Lightning 的设计从一开始就是为了在 NVIDIA 自有硬件上运行——Jetson、GeForce RTX 5090、DGX Spark、DGX Station——而不是必须通过云端 API。当 Switchyard 将执行层请求路由到 Lightning,而这些 Lightning 实例运行在本地 NVIDIA 硬件上时,这部分推理负载就不会流向 Google 的 TPU、AWS 的 Trainium 或其他竞品加速器。

与 NemoClaw(NVIDIA 的开源 Agent 安全和管理栈)配合,整个 Agent 执行链路——从安全沙箱到模型路由再到推理硬件——都在 NVIDIA 的控制面内。这不是封闭生态,但也不是中立的。开源降低了采纳门槛,但硬件路径依赖一旦建立,切换成本会随着 Agent 数量的增加而成倍增长。

对开发者:新经济学,新复杂度

"大小模型分工"的 Agent 架构不是 NVIDIA 的发明。Anthropic 的 Claude Code 在内部已经在做类似的分层调用;OpenAI 的 Codex 团队也在探索规划模型与执行模型的分离。但 NVIDIA 是第一个将这套架构打包成开源基础设施组件、并用合作伙伴数据来验证经济性的玩家。

对于开发者,这意味着几件事:

省钱的前提是先知道自己需要什么。 Futurum Group 建议企业先测量自己的 token 分布——如果只有 10%-20% 的调用真正需要 frontier 推理(这是"装备良好的 Agent"的典型水平),路由架构才值得工程投入。如果团队连这个数据都拿不出来,加上路由只会增加复杂度。

从两个模型开始。 NVIDIA 的数据已经表明,大部分节省来自两模型池,再多模型带来的额外收益很小。复杂的"模型系统"叙事与实际数据之间存在差距。

路由带来审计负担。 在受监管行业,每一步具体由哪个模型生成输出是合规问题而非技术偏好。Switchyard 虽内置了指标记录,但在企业部署中仍需要补充逐步骤的归因和调试工具。

开源的路由器,不开源的控制权

Shashi Bellamkonda 在分析中提出了三个尖锐问题,值得任何考虑采用 Switchyard 的团队思考:路由逻辑是否足够开放,允许企业在不丢失 Kong 和 LiteLLM 集成的情况下替换 NVIDIA 的默认算法?路由器的默认配置在规模扩大后是否会逐渐倾向于 Nemotron 模型?下一批采用者能否复现 Boomi 和 Ramp 那样精确的数据?

Switchyard 是开源的,GitHub 仓库任何人都可以 fork。但一旦它被接入企业的网关层、与几十个 Agent 工作流耦合、成为成本模型和延迟 SLA 的基础,替换它的代价就远高于替换一个模型 checkpoint。NVIDIA 选择开源路由器的决定看起来慷慨,但它同样意味着:路由层这个新的控制点,是由 NVIDIA 定义、NVIDIA 主导集成、NVIDIA 拥有最深厚专业经验的。

这比任何单次模型发布都更持久——这才是这次发布真正值得关注的信号。

来源

  1. NVIDIA Developer Blog: Nemotron 3.5 Lightning · NVIDIA
  2. Artificial Analysis: Nemotron 3.5 Lightning Launch
  3. Futurum Group: Who Decides Which Model Runs? NVIDIA Would Like a Say · Futurum Group
  4. NVIDIA Ships a Router That Outlasts the Model Beside It
  5. SiliconAngle: Nvidia releases Nemotron 3.5 Lightning and NeMo Switchyard · SiliconAngle
  6. NVIDIA Newsroom: Nemotron 3.5 Lightning and NeMo Switchyard · NVIDIA

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Grok Bot launch announcement hero image showing the product branding

    Grok Bot 给 AI Agent 配了一台永不离线的云电脑

    算法 · 2026-08-12

  • Andrew Bird 手持手机,他的 AI Agent 在预订健身房课程时发现了系统漏洞

    从沙箱到健身房:消费者 AI Agent 的安全边界早已失守

    算法 · 2026-08-10

  • Motif Technologies 标志

    Motif-3 正式发布:韩国 30 人团队用政府算力造出 MIT 许可的 314B MoE,Agent 基准领跑四强

    算法 · 2026-08-10

  • Muse Glimmer 模型发布概念图,展示蓝色 Meta 笔记本电脑

    Glimmer:Apache 2.0 许可 + 完整推理栈,Meta 的开源反击不只是又一个模型

    算法 · 2026-08-10

  • 微软 Copilot 的动画角色 Mico,本次将从 Copilot Voice 中移除并迁往 Learn Live

    微软合并 Copilot 应用、下线五个功能,Deep Research 改为付费项

    算法 · 2026-08-13

  • X 应用设置中的 Under the Hood 透明度工具截图,展示可下载账户与帖子排序标签 JSON 数据的功能

    X 开源推荐排序代码,违规判定仍留在黑箱里

    算法 · 2026-08-13

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS