智东西(公众号:zhidxcom)
编译 | 茄子
编辑 | 程茜
智东西8月12日消息,昨日,英伟达发布开源大语言模型Nemotron 3.5 Lightning,以及面向Agent的开源智能路由库NeMo Switchyard。前者总参数量为300亿,推理时仅激活约30亿参数,输出速度最高达到同等规模模型的4倍;后者可以在多款模型之间自动分配任务,英伟达内部测试显示,其任务完成成本可降至全部使用Claude Opus 4.8时的1/3。

▲Nemotron 3.5 Lightning和NeMo Switchyard开源(图源:Hugging Face、Github)
Nemotron 3.5 Lightning是英伟达7月24日签署支持开源AI模型的联名公开信后,首次推出的开源模型。
英伟达创始人兼CEO黄仁勋称,Nemotron 3.5 Lightning适用于持续运行和长时间工作的Agent,并将其概括为“智能、快速、高效且开源”。

▲黄仁勋转发Nemotron 3.5 Lightning发布消息(图源:X)
大模型测评机构Artificial Analysis对总参数量低于400亿的开放权重模型进行了比较。Nemotron 3.5 Lightning综合能力得分为24分,输出速度约为670 token/s,是图中唯一进入高速度、高得分区域的模型。

▲Nemotron 3.5 Lightning在Artificial Analysis的评测结果(图源:X)
英伟达称,Nemotron 3.5 Lightning主要承担Agent执行长程任务时的工具调用、结果检查、格式整理和代码操作等高频工作。在技术上,Nemotron 3.5 Lightning结合多token预测、推测解码和低精度量化等技术提高推理效率。
为了进一步降低整个Agent工作流的运行成本,英伟达还推出NeMo Switchyard路由库,对不同模型进行统一调度。
据技术博客称,NeMo Switchyard会路由库根据任务难度、模型能力、成本和延迟选择模型,将复杂规划交给能力更强的前沿模型,把工具调用、结果检查和格式整理等高频操作交给速度更快、成本更低的模型。在LangChain完成的145项多轮Agent任务测试中,Switchyard仅将7%的请求交给前沿模型,整体成本降低74%
此外,据外媒The Information昨日报道,英伟达正在研发更大规模的Nemotron 4系列,其最大版本预计至少拥有1万亿参数,目标是达到全球领先开源模型的水平。不过,该模型尚未完成最终训练,具体规格及发布时间均未确定。
目前,Nemotron 3.5 Lightning已全面开放至Hugging Face、ModelScope、OpenRouter以及英伟达官方开发者平台,供开发者下载与调用,NeMo Switchyard也已在GitHub开源。
Nemotron 3.5 Lightning开源链接:
https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
NeMo Switchyard开源链接:
https://github.com/NVIDIA-NeMo/Switchyard
一、300亿参数每次激活30亿,1万项Agent任务完成速度比Qwen 3.6快30%
Nemotron 3.5 Lightning采用混合专家架构。该模型包含300亿参数,但处理每个token时,路由器只会调用少量专家模块,因此每次推理激活约30亿参数。这种设计使模型在保留300亿参数总体容量的同时,减少每次推理实际参与计算的参数量,从而降低计算开销。
英伟达将Nemotron 3.5 Lightning定位为Agent执行长程任务中的工作模型,主要负责工具调用、检查工具返回结果、整理输出格式和运行代码命令等高频操作。
在这套模型分工中,Nemotron 3 Ultra等前沿推理模型负责复杂规划和任务编排,Nemotron 3.5 Lightning则执行数量更多、流程相对固定的具体任务。英伟达认为,如果每一步都调用前沿模型,会增加成本和延迟。
Artificial Analysis测试显示,Nemotron 3.5 Lightning处于同类开源模型的能力—速度“帕累托前沿”,即目前没有其他参测模型能在综合能力和输出速度两项指标上同时超过它。

▲Nemotron 3.5 Lightning在准确率与输出速度方面的表现(图源:英伟达)
在更关注Agent实际任务完成效率的PinchBench测试中,Nemotron 3.5 Lightning以86%的准确率完成1万项任务。在准确率相近的情况下,其任务完成速度比Qwen 3.6 35B快30%。

▲Nemotron 3.5 Lightning与同类模型的Agent任务完成效率对比(图源:英伟达)
英伟达称,该模型的输出速度最高可达到同等规模模型的4倍。不过,这一数据主要反映特定部署环境下的生成速度,并不代表Nemotron 3.5 Lightning在综合智能方面超过所有同规模模型。
目前,网络安全厂商CrowdStrike、法务AI平台Harvey、代码审查工具商CodeRabbit正分别探索将该模型用于网络安全、法律服务和代码审查;科研平台Lila Sciences参与提升其物理及生命科学任务的推理能力,垂直微调服务商Fastino Labs则针对软件开发、金融和医疗场景进行了定制。

▲多家企业针对专业任务定制Nemotron 3.5 Lightning(图源:英伟达)
技术方面,Nemotron 3.5 Lightning在训练中加入多token预测能力,可以提前预测后续多个token,再对预测结果进行验证。英伟达还为其提供DSpark和DFlash两款草稿模型,用于快速生成待验证内容,以进一步提高推测解码速度。
该模型同时提供BF16和NVFP4版本,可运行在Jetson、GeForce RTX 5090和DGX Spark等本地设备上,也能部署至工作站、数据中心及云环境。
Nemotron 3.5 Lightning现已上线Hugging Face、ModelScope、OpenRouter和英伟达开发平台。英伟达还开源了用于强化模型编程Agent能力的数据集Nemotron-RL Agentic Terminal Pivot。
成为付费用户可以阅读 英伟达 所有资料
了解更多 →