蚂蚁百灵发布Ling-3.0-tiny轻量推理模型

AIGC行业资讯7小时前发布 zhang
1 0

蚂蚁集团旗下百灵(inclusionAI)于今日发布轻量级混合推理模型 Ling-3.0-tiny,该模型总参数为 7.9B,但每个token仅激活 1.3B 参数,旨在以较低推理成本提供强大的推理与智能体能力,使先进模型能力更易于本地及资源受限环境部署。模型已在Hugging Face、ModelScope和OpenRouter等平台上线,并提供BF16、FP8和INT4多种精度权重,适配广泛硬件与部署场景。

Ling-3.0-tiny继承了Ling-3.0系列的混合线性注意力架构,并针对轻量化和易部署进行了优化。其架构采用 3:1 的KDA与MLA交替堆叠(每4层中包含3层Kimi Delta Attention和1层Multi-Head Latent Attention),配合包含 128个路由专家 的稀疏MoE FFN,每个token仅激活8个路由专家和1个共享专家,从而在长上下文建模、参数效率和计算成本之间取得平衡。模型原生支持混合推理,可通过 `enable_thinking` 参数按请求配置思考模式,既能快速响应常规任务,也能进行多步推理,适用于通用智能体任务、编程、数学与科学推理及指令遵循等场景。

在性能验证方面,Ling-3.0-tiny已在 NVIDIA DGX SparkApple Silicon MacBook 和 Mac mini 上完成验证,无需数据中心级GPU即可运行推理与智能体工作负载。在FP8精度下,模型在DGX Spark上可达到约 100-105 tokens/s 的生成速度,在M4 Pro MacBook上为 86-90 tokens/s,8K上下文时峰值内存占用约 8.34 GiB。在Artificial Analysis测试中,模型输出速度超过 160 tokens/s,生成500 token响应(含推理时间)的端到端延迟约 18秒。在Artificial Analysis Intelligence Index v4.1.1上得分为 25,Agentic Index得分为 16

模型支持通过SGLang和vLLM进行部署,并提供了针对低延迟、高吞吐等场景的启动配置。推荐采样参数为 temperature=1.0、top_p=0.95、top_k=20,思考模式默认开启。在SGLang中,模型可在单块141GB级GPU(如H20-3e)或单GPU Blackwell节点上运行,支持256K上下文长度,并内置MTP/NEXTN推测解码以提升效率。vLLM支持则通过专门的代码分支提供。

Ling-3.0-tiny的发布体现了蚂蚁百灵在轻量级模型方向的布局,其低激活参数和高效推理特性,有望降低AI应用在本地和边缘设备的部署门槛,推动智能体工作流在更广泛场景中的落地。对于AI产业链而言,这类模型的推出可能影响推理成本结构,并促进端侧AI应用的创新

© 版权声明

相关文章

堆友更新