AI 模型

NVIDIA 发布 Nemotron 3.5 Lightning 与 NeMo Switchyard,面向多模型智能体

NVIDIA 推出一款适用于专门化智能体任务的高效开放模型,以及一个旨在平衡模型质量、速度与成本的开放路由库。

发布于 更新于
NVIDIANemotron 3.5 LightningNeMo Switchyard

NVIDIA 以 Nemotron 3.5 Lightning 扩充了其开放模型阵容,并发布了 NeMo Switchyard。后者是一个路由库,旨在帮助智能体系统从多个模型中作出选择,而不是将每个请求都发送给同一个模型。此次 8 月 11 日发布的产品,将一个面向高吞吐量专门化工作的相对紧凑模型,与能够按照准确性、延迟和成本等要求为智能体工作流每一步进行分流的软件结合起来。两者共同表明,行业正在从单个模型之间的竞争,转向由不同模型承担不同角色的系统。

Nemotron 3.5 Lightning 是一个拥有 300 亿参数的混合专家模型。在这种架构中,针对某个请求只会激活网络的一部分,使模型无需为每个 token 调用全部参数,便能提供更大的总体容量。NVIDIA 将 Lightning 定位为大型智能体系统中的执行者,而不是必须规划并解决任务每一个环节的模型。该公司列举的目标专门任务包括代码审查、工具使用、安全警报监控和账单问题,而更大的前沿模型则可以协调更广泛的工作流。

该公司称,Lightning 的输出速度最高可提升至同类其他模型的四倍,完成智能体任务的速度可快 30%。这些数字来自 NVIDIA 及其公告中描述的评测,因此买家仍需在自己的工作负载上测试该模型。此次发布由 Nemotron Coalition 成员共同参与开发,NVIDIA 还将公开一份用于编码智能体后训练的智能体强化学习数据集。组织也可以使用 NVIDIA NeMo,结合自身领域数据、工具和工作模式来调整该模型。

部署灵活性是其主打卖点之一。NVIDIA 表示,该模型既可在 RTX PC、DGX Spark、DGX Station 和 Jetson 系统上本地运行,也可部署于工作站、数据中心、边缘设备和云服务。当任务请求量很大、要求快速响应,或涉及组织不愿发送给第三方模型端点的信息时,本地或自有环境运行可能尤为重要。Lightning 可通过 Hugging Face、ModelScope、OpenRouter 以及 NVIDIA 的服务获取,其中包括 NVIDIA NIM 微服务。

NeMo Switchyard 处理的是另一类成本来源。能力强大的前沿模型可能适合高难度推理步骤,但用来完成常规分类或查询则可能过于昂贵。这个开源库允许开发者创建路由器,在不重写周边应用的情况下,将提示词发送给不同的开放模型、专有模型或 NVIDIA 模型。其路由逻辑可以修改,以体现团队对质量、响应时间和费用的偏好平衡。NVIDIA 称,其内部基准测试在保持前沿级准确率的同时,将任务完成成本降低到仅使用 Opus 4.8 时的近三分之一。

公告中的合作伙伴结果同时展示了路由方案的潜力与局限。LangChain 报告称,在 145 项多轮 Deep Agents 任务中,仅有 7% 的调用进入前沿模型时,成本降低了 74%,但准确率也牺牲了 6%。Ramp 表示,在其软件工程基准测试中,它在达到前沿模型性能的同时,将成本削减 58%,运行时间缩短 33%。Cognition 报告称,在 NVIDIA 内部环境中与 Devin Desktop 配合使用的分阶段路由器,使平均成本下降了 28%。这些都是供应商和合作伙伴的测量结果,并非普遍保证。

此次发布使模型选择成为智能体产品中的一项明确工程决策。路由器可以减少浪费,但也会引入另一个必须评估的组件:选择不当的路由可能在省钱的同时降低答案质量,或把敏感任务发送到错误的环境。对 Nemotron 3.5 Lightning 和 Switchyard 的实际检验,将是团队能否衡量路由决策、发现质量倒退,并在任务要求指定模型时覆盖系统选择。如果这一运营层经受住考验,多模型智能体对某一个昂贵默认模型的依赖可能会降低,并更接近其他分布式软件系统:根据各项工作挑选最适合执行它的专门服务。