2026 年 8 月 11 日,NVIDIA 发布了 Nemotron 3.5 Lightning——一个 300 亿参数的混合专家(MoE)模型,活跃参数仅 30 亿。同时开源的还有 NeMo Switchyard,一个智能模型路由库。两者的组合瞄准的是一个更工程化的问题:长期运行的 AI Agent 大部分时间在做什么,应该用什么模型来做。

长时 Agent 的真实开销
当一个 AI Agent 持续运行——代码审查、安全监控、工单处理、文件操作——它的大多数步骤是高频率、低复杂度的执行任务:拉取代码、验证工具输出、格式化结果、执行常规 API 调用。这些步骤不需要前沿推理模型的智力,但它们消耗了绝大部分的 token 预算和延迟时间。
用 GPT-5.6 级别的模型执行每一步,意味着为简单任务支付溢价并承受高延迟。NVIDIA 的方案是把 Agent 看作一个"模型系统"(system of models):前沿推理模型(如 Nemotron 3 Ultra)负责编排和复杂规划,小模型负责高频执行层。Nemotron 3.5 Lightning 就是这个执行层的设计。
MoE 架构:30B 容量,3B 计算量
混合专家模型的核心机制是路由:每个 token 只激活模型中的一小部分专家网络。Nemotron 3.5 Lightning 有 300 亿总参数,但每个 token 只激活 30 亿参数(A3B = Active 3B)。这意味着模型拥有接近大参数模型的容量,但推理时的计算量只相当于一个 3B 级别的密集模型。
NVIDIA 在训练阶段嵌入了多 token 预测(Multi-Token Prediction, MTP),使模型能够一次预测多个 token。推理时通过推测解码(speculative decoding)实现加速:草稿模型先生成候选 token,主模型快速验证,从而在单次前向传播中输出多个 token。Nemotron 3.5 Lightning 附带两个草稿模型:
- DSpark:面向 DGX Spark 等本地设备和低并发数据中心场景优化
- DFlash:可在不同负载下与其他草稿模型对比测试,针对特定工作负载可能表现更优
模型同时发布 NVFP4 和 BF16 两个精度版本。NVFP4 使用与 Nemotron 3 Ultra 相同的专用量化内核,支持 NVIDIA Blackwell、Hopper 和 Ampere 架构 GPU。同一个权重文件既能在数据中心跑,也能在桌面级 DGX Spark 上跑。
PinchBench:精度与速度的帕累托前沿
PinchBench 是一个 Agent 任务基准测试。在 10,000 个任务的完成测试中,Nemotron 3.5 Lightning 达到约 86% 的准确率,完成速度比同级别的 Qwen3.6 35B 快 30%。在 Artificial Analysis Intelligence Index(综合 9 项评测,覆盖 Agent 任务、编码、科学推理和通用智能)上,Nemotron 3.5 Lightning 在同级模型中占据了精度-速度帕累托前沿的位置。

图中横轴是完成 10,000 个任务所需的 GPU 小时数,纵轴是准确率。Nemotron 3.5 Lightning 位于左上角"高精度、高速度"区域,与 Qwen3.6 35B、Gemma 4 26B 拉开了明显的差距。
NeMo Switchyard:模型路由的工程化
光有一个高效的执行层模型还不够。在一个多模型 Agent 系统中,核心问题是:每个请求应该发给哪个模型?
NeMo Switchyard 就是为这个问题设计的开源路由库。它的工作方式是:在运行时评估每个请求及其上下文,然后把请求发送到最适合该任务的模型。开发者可以调整路由算法来匹配自己的优先级——质量、延迟、成本,或者三者的组合。
路由决策依赖三类信号
| 信号类型 | 具体内容 | 获取方式 |
|---|---|---|
| 模型能力 | 哪些模型能正确解决该任务 | 分类器匹配、嵌入模型提取特征 |
| 模型成本 | 延迟和调用成本 | 定价、负载、错误率等系统信号 |
| 基础设施 | 无缝切换的可靠性 | logprobs、级联、Agent 轨迹 |
内置路由算法
Switchyard 提供两类路由器:
免调参路由器(无需在特定数据上训练):
- LLM 分类器:用 LLM 充当裁判,为请求选择候选模型,并在会话中保持亲和性。适合按领域分流(编码任务发给模型 A,数学任务发给模型 B)。
- 阶段路由器:根据编码 Agent 的阶段动态切换。早期探索和错误恢复阶段路由到强能力模型;后期实现和测试通过后切换到高效模型。路由器检查近期的工具活动来判断当前需要多少模型能力。
- 升级路由器:从低成本模型开始,由 LLM 裁判逐轮监控任务进展。当检测到持续困难时,自动升级到更强的模型。
可调参路由器(从真实工作负载数据中学习):
- 预填充路由器:训练时从 LLM 的残差流中提取信号,估计查询的复杂度。一个共享主干 MLP 把这些信号映射到每个候选模型的准确率标签。推理时,预填充状态作为路由器输入,预测每个模型成功完成任务的概率。
switchyard-libsy:与 Provider 解耦的 SDK
Switchyard 的底层 SDK 叫 switchyard-libsy,设计上与 Provider 无关。每个模型目标有一个语义名称(如 "frontier-code"、"fast-execution"),客户端把名称映射到具体的 Provider 端点和模型 ID。这意味着更换 Provider、更新模型版本或迁移端点不需要修改路由逻辑。
Switchyard 的参考服务器支持 OpenAI、Anthropic 和 Responses API 格式的请求,把它翻译成内部格式并返回对应的响应格式。它记录每次路由选择的模型、决策理由、token 使用量和延迟,方便团队审查运行中的路由策略。
实际部署:成本削减的真实数据
NVIDIA 的合作伙伴已经在生产环境中跑出了具体数字:

- LangChain:在 145 个多轮 Agent 任务(Deep Agents 评测套件)上,用升级路由器在 Nemotron 3.5 Lightning 和 Claude Opus 4.8 之间路由,仅 7% 的调用发往前沿模型,成本降低 74%,精度代价约 6 个百分点。
- Cognition:在 Devin Desktop 中实现阶段性路由,在 FrontierCode Main 基准上达到 50.6% 的准确率,平均成本 3.11 美元——与单独使用 Opus 5 相比,准确率差距仅 2.8 个百分点,平均成本降低 28%。
- Ramp:在 Ramp SWE-Bench 上匹配前沿模型性能的同时,成本削减 58%,运行时间缩短 33%。
- Kong:通过 Kong AI Gateway 原生提供 NeMo Switchyard 路由能力。
- Nous Research:已将 NeMo Switchyard 集成到 Hermes Agent 中。
NVIDIA 内部基准显示,NeMo Switchyard 在保持前沿级精度的同时,将任务完成成本降低到单独使用 Opus 4.8 的约三分之一。
开源与可定制性
Nemotron 3.5 Lightning 采用 OpenMDW-1.1 许可证发布,权重、训练数据和微调配方全部公开。支持以下定制路径:
- LoRA 或全量 SFT 微调,通过 NeMo Automodel 和 NeMo Megatron Bridge
- 强化学习和环境评测,通过 NeMo RL 和 NeMo Gym
- 附带 Nemotron-RL Agentic Terminal Pivot 数据集,用于训练编码 Agent 能力
模型已在 HuggingFace、ModelScope、OpenRouter 和 build.nvidia.com 上线,同时支持 vLLM、SGLang、TensorRT-LLM 部署,以及 LM Studio、llama.cpp、Ollama 等本地推理工具。硬件覆盖从 NVIDIA Jetson、GeForce RTX 5090 到 DGX Spark,再到数据中心级 GPU。
开发者影响
Nemotron 3.5 Lightning 和 NeMo Switchyard 的组合面向的是一个正在成型的架构模式:Agent 系统不再依赖单一模型,而是由多个专用模型协同工作。前沿模型做规划和复杂推理,高效模型做高频执行,路由器在两者之间做动态分配。
对于正在构建 Agent 系统的开发团队,这套方案降低了两个核心成本:一是推理成本(用小模型处理简单任务),二是集成成本(路由器自动决定模型选择,不需要为每个 Provider 重写应用逻辑)。Switchyard 与 Provider 解耦的设计意味着团队可以在不修改路由逻辑的前提下更换底层模型,这在一个模型快速迭代的环境中尤其重要。
来源:
- NVIDIA Blog: Nemotron 3.5 Lightning and NeMo Switchyard
- NVIDIA Developer Blog: Nemotron 3.5 Lightning 技术深度
- NVIDIA Developer Blog: NeMo Switchyard 模型路由
- HuggingFace: NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
- GitHub: NVIDIA-NeMo/Switchyard