英伟达发布 Nemotron 3.5 Lightning:30B MoE 模型专攻高吞吐低延迟代理执行

AIGC行业资讯7小时前发布 zhang
0 0

英伟达于 8 月 11 日发布开源模型 Nemotron 3.5 Lightning,这是一款 30B 参数的混合专家(MoE)模型,但仅有 3B 参数在每次推理时激活。该模型专为长时运行的 AI 代理设计,旨在处理高频、低延迟的执行任务,如工具调用、结果验证和子代理委派,从而避免为每一步执行都调用前沿推理模型所带来的高昂成本与延迟。

在架构上,MoE 模型通过路由器将每个 token 仅发送给少数专家,因此每次推理只激活部分参数,从而以较小计算成本获得接近大型稠密模型的能力。Nemotron 3.5 Lightning 是 Nemotron 3 家族中最小成员,继承了家族多项优化技术,包括投机解码(训练时引入多 token 预测)、DFlash 与 DSpark 推理优化,以及针对流行代理框架(如 OpenClaw 和 Hermes Agent)的训练优化,使代理在高频任务中能更准确调用并降低延迟。模型还支持 NVFP4 和 BF16 量化检查点,输出速度较同类模型最高提升 4 倍,可部署于从 NVIDIA DGX Spark 到数据中心的各类环境。

英伟达同时推出 NeMo Switchyard 模型路由库,允许开发者将 Nemotron 3.5 Lightning 与其他开源或闭源模型一同作为路由目标,实现任务智能分配:规划类任务路由至前沿模型(如 Nemotron 3 Ultra),执行类任务则路由至 Lightning,从而高效利用 token 预算。该模型以 OpenMDW-1.1 许可发布,提供权重、训练数据和配方,支持 LoRA 或全量微调,并附带 Nemotron-RL Agentic Terminal Pivot 数据集,用于训练编码代理能力。

在性能上,英伟达称该模型在 Artificial Analysis Intelligence Index(综合九项评估,涵盖代理任务、编码、科学推理和通用智能)上实现了同类最高的输出速度与领先的准确性,占据准确率-速度帕累托前沿。

此次发布反映了代理式 AI 开发中“模型系统”趋势的加速:前沿模型负责复杂规划,而轻量高效模型承担高频执行。对于 AI 产业而言,这有助于降低长时运行代理的推理成本,提升整体效率,并可能推动模型编排与路由技术的成熟。

© 版权声明

相关文章

堆友更新