企业选模型的标准正在从“哪个最强”转向“哪个够用、哪个快、哪个划算”。当AI智能体成为企业应用的标配,它们承担的任务从成批的简单小任务,一路延伸到需要跨深度知识领域的复杂推理。前者交给能快速处理批量小任务的轻量模型即可,后者才需要高智能、强推理的前沿模型。
问题已经不再是谁的算力更强,而是哪一个任务该交给哪一个模型。
英伟达今天的两个发布,是对这条逻辑的直接回应。
它推出了一款高度可定制、主打高效率的新模型Nemotron 3.5 Lightning,以及一个名为NeMo Switchyard的智能体模型路由器。前者补上“执行型”模型的位置,后者则解决“模型足够多之后,谁来调度”的问题。
一款为“执行”而生的轻模型
Nemotron 3.5 Lightning是一个总参数约300亿的混合专家模型,单次推理只激活约30亿参数。英伟达称,相比同类模型,它的输出速度最高提升约4倍,智能体任务完成速度提升约30%。
它的定位不是取代最强的前沿模型,而是成为多智能体系统里的“执行型”模型。在一个复杂的企业AI系统里,大模型负责任务规划和复杂推理,Lightning则承担大量代码审查、安全监控、数据处理、告警分析这类专业化工作。混合专家架构的价值正在于此,总参数不小,但每次推理只激活其中一小部分,单次token计算成本随之下降。
这里需要厘清一个落差,输出快4倍,并不意味着整个任务能快4倍。
模型推理只是智能体工作流的一环,工具调用、API响应、多智能体之间的任务编排都会形成新的瓶颈,实际任务提速被压缩到约30%。这也是英伟达在同一个节点端出Switchyard的原因,只解决“单个模型跑得快”远远不够,还要解决“每一步该用哪个模型”。
第三方评测机构Artificial Analysis的数据印证了Lightning的执行能力。它的Intelligence Index得分为24,比上一代小尺寸型号Nemotron 3 Nano高出9分,与OpenAI的gpt-oss-120b相当,仅落后于规模约为其4倍的Nemotron 3 Super 2分。在代理任务相关的GDPval-AA v2评测上,它的Elo达到824,超越Nemotron 3 Super和gpt-oss-120b;在Terminal-Bench v2.1上拿到24%的成绩,而Nemotron 3 Nano只有7%。在预发布测试中,其输出速度接近每秒670个token。
模型足够多之后,路由成为新软件层
Lightning的另一重差异化在于它开放且易于定制。企业可以在自己的硬件上,用NeMo针对专有领域数据、工具和工作流进行二次训练。
“我们听到的是,Lightning极易定制。”英伟达生成式AI副总裁Kari Briski说。据她介绍,CodeRabbit用英伟达的标准模型配方训练了一个epoch,约两小时、花85美元就产出了一个路由智能体。另一个伙伴把Lightning直接放进已有的后训练栈,“无需任何改动”。还有一个公司用单张H100卡就完成了训练,另一个干脆晚上跑训练任务,早上来取结果。
“这正在把后训练和微调变成把碗放进洗碗机、然后按下启动键。”Briski说。
英伟达同时放出了它的数据集、后训练数据集,以及训练模型所用的配方和框架。开发者可以把英伟达的后训练数据与企业自有数据混在一起,做出“取两家之长”的混合模型。“这就是为什么我们看到人们很快得到很好的结果。”Briski说。
NeMo Switchyard是一个开源的模型路由库。它会考虑当前有多少模型可用、各自能力如何,在智能体工作流的每一步,把请求路由到当时最合适、最高效的模型。开发者可以根据质量、延迟、成本等优先级,自定义路由策略。
对未来的多智能体系统而言,真正重要的或许已经不是“哪个模型最好”,而是哪个任务该由哪个模型完成。企业不必让每一个任务都用最贵的模型。英伟达与Boomi、Cadence Design Systems、Classmethod、Cognition、Kong、Langchain、Nous Research、Siemens等一批生态伙伴合作,把智能路由接入开发者已在使用的工具。
把Lightning和Switchyard放在一起看,英伟达的判断清晰可见,随着模型数量越来越多,模型之间的调度和协同会成为新的软件层。
从Nemotron 4到与OpenAI的微妙关系
这两次发布只是英伟达开源模型战略的局部。Nemotron 3家族去年12月推出,当时有三个尺寸,Nano、Super、Ultra。据The Information报道,英伟达正在开发下一代Nemotron 4,目标参数量至少1万亿,约为其现有最大模型Nemotron 3 Ultra的两倍,旨在与全球顶尖开源模型比肩。
它还组建了一个包含Reflection、Cursor、Thinking Machines、Mistral等在内的“Nemotron联盟”,多方在推进自身模型的同时,向Nemotron 4贡献训练数据、评估支持和设计方案。
这背后是英伟达微妙的处境。其芯片需求高度集中于OpenAI、微软、SpaceX等少数前沿实验室和云服务商,而英伟达已向OpenAI投资300亿美元;另一边,Nemotron 4恰恰定位为企业提供成本更低的替代方案,与这些前沿实验室形成竞争。它一边给客户供芯片,一边下场造模型,边界正在变得模糊。
不过对英伟达而言,这未必是零和游戏。AI模型评测机构Arena的首席执行官Anastasios Angelopoulos的一句话点破逻辑,“无论哪家公司做出优秀的开源模型,英伟达都是赢家。”开源生态越繁荣、参与主体越多元,GPU的整体需求就越旺盛。
成为付费用户可以阅读 英伟达 所有资料
了解更多 →