英伟达发布Nemotron 3.5与模型路由器,从卖芯片转向卖AI工作流

AIGC行业资讯4小时前发布 zhang
0 0

英伟达今日发布了两款面向企业AI的新产品:高效模型Nemotron 3.5 Lightning和智能体模型路由器NeMo Switchyard。这一组合标志着英伟达正从单纯的芯片供应商,向提供完整AI工作流解决方案的平台公司转型。

Nemotron 3.5 Lightning是一款总参数约300亿的混合专家模型,单次推理仅激活约30亿参数。英伟达称,相比同类模型,其输出速度最高提升约4倍,智能体任务完成速度提升约30%。该模型定位为多智能体系统中的“执行型”模型,负责代码审查、安全监控、数据处理、告警分析等专业化任务,而复杂推理仍由前沿大模型承担。混合专家架构使每次推理只激活部分参数,从而降低单次token计算成本。

值得注意的是,输出速度提升4倍并不等于整体任务提速4倍。模型推理只是智能体工作流的一环,工具调用、API响应、多智能体间的任务编排都会形成新瓶颈,因此实际任务提速被压缩至约30%。这正是英伟达同时推出NeMo Switchyard的原因——不仅要让单个模型跑得快,还要解决“每一步该用哪个模型”的调度问题。

第三方评测机构Artificial Analysis的数据显示,Lightning的Intelligence Index得分为24,比上一代小尺寸型号Nemotron 3 Nano高出9分,与OpenAI的gpt-oss-120b相当,仅落后于规模约为其4倍的Nemotron 3 Super 2分。在代理任务相关的GDPval-AA v2评测上,其Elo达到824,超越Nemotron 3 Super和gpt-oss-120b;在Terminal-Bench v2.1上取得24%的成绩,而Nemotron 3 Nano仅为7%。预发布测试中,其输出速度接近每秒670个token。

Lightning的另一大特点是开放且易于定制。企业可在自有硬件上,用NeMo框架针对专有领域数据、工具和工作流进行二次训练。英伟达生成式AI副总裁Kari Briski介绍,CodeRabbit用英伟达的标准模型配方训练一个epoch,约两小时、花费85美元就产出了一个路由智能体;另一合作伙伴将Lightning直接放入已有后训练栈,无需任何改动;还有公司用单张H100卡完成训练,或晚上跑训练任务、早上取结果。英伟达同时开放了数据集、后训练数据集以及训练配方和框架,开发者可将英伟达的后训练数据与企业自有数据混合,构建“取两家之长”的定制模型。

NeMo Switchyard是一个开源模型路由库,它根据当前可用模型的数量和能力,在智能体工作流的每一步将请求路由到最合适、最高效的模型,开发者可按质量、延迟、成本等优先级自定义路由策略。英伟达已与Boomi、Cadence Design Systems、Classmethod、Cognition、Kong、Langchain、Nous Research、Siemens等生态伙伴合作,将智能路由集成到开发者现有工具中。

这两款产品是英伟达开源模型战略的最新一步。Nemotron 3家族于去年12月推出,包含Nano、Super、Ultra三个尺寸。据The Information报道,英伟达正在开发下一代Nemotron 4,目标参数量至少1万亿,约为现有最大模型Nemotron 3 Ultra的两倍,旨在与全球顶尖开源模型比肩。英伟达还组建了包含Reflection、Cursor、Thinking Machines、Mistral等在内的“Nemotron联盟”,多方在推进自身模型的同时,向Nemotron 4贡献训练数据、评估支持和设计方案。

英伟达的处境微妙:其芯片需求高度集中于OpenAI、微软、SpaceX等少数前沿实验室和云服务商,而英伟达已向OpenAI投资300亿美元;另一边,Nemotron 4定位为企业提供成本更低的替代方案,与这些前沿实验室形成竞争。它一边给客户供芯片,一边下场造模型,边界日益模糊。

不过,这未必是零和游戏。AI模型评测机构Arena的首席执行官Anastasios Angelopoulos指出:“无论哪家公司做出优秀的开源模型,英伟达都是赢家。”开源生态越繁荣、参与主体越多元,GPU的整体需求就越旺盛。英伟达的角色正从卖芯片的转变为卖整个AI工作流的,只要模型跑在英伟达的路由、推理和部署体系内,无论企业最终选择谁的模型,它都能从整个工作流中获益。这正是Switchyard与Nemotron 3.5同时发布的深层含义。

© 版权声明

相关文章

堆友更新