seedance2.5

书生发布Intern-S2-Mobius:35B模型实现近4倍推理加速

AIGC行业资讯13小时前发布 zhang
0 0

书生团队(InternLM)在 Hugging Face 上发布了 Intern-S2-Mobius,一个基于 Mobius-v0 架构的 35B 参数多模态基础模型(支持图像-文本到文本任务)。该模型从 Qwen3.5-35B 持续预训练而来,并经过 SFT 与 RL 后训练,在保持下游能力的同时,实现了接近 4 倍 的端到端推理加速。

Mobius 架构的核心创新在于将知识存储与推理计算解耦。传统 Transformer 模型将知识存储与推理计算逐层绑定,而 Mobius 将知识组织为全局共享的 Memory,让多个 Reasoner 迭代地查询并精炼隐藏状态。这种设计赋予了模型两个原生能力:Backward Residual Connection(后向残差连接),使推理阶段可以访问超越局部层层次的知识;以及 Dynamic Latent Reasoning(动态潜在推理),将思考、精炼和多 token 预测内化到高密度连续状态中。

在推理效率方面,Intern-S2-Mobius 在推理基准上达到了与 Qwen3.5-35B 相当或更强的分数,同时产生明显更短的推理轨迹和更高的请求吞吐量,据技术报告称,端到端推理加速接近 4 倍。在通用推理基准上,该模型相比 Qwen3.5-35B 提升了平均分,并在科学任务(如 Biology-InstructionsMol-InstructionsMolecularIQ)上表现出显著增益。

模型评估使用 OpenCompass 进行,文本基准中,MMLU Pro、SimpleQA 和 HLE 的最大推理长度为 64K tokens,其余文本基准为 128K tokens。官方推荐采样参数为 top_p=0.95、top_k=50、min_p=0.0、temperature=0.8。部署方面,Intern-S2-Mobius 支持 LMDeployTransformer 和 vLLM 等主流推理框架。

这一发布对 AI 产业具有多重含义。首先,知识-推理解耦架构为提升大模型推理效率提供了新思路,可能降低推理阶段的算力成本,对依赖大规模部署的 AI 应用具有吸引力。其次,模型基于 Qwen3.5-35B 持续预训练,体现了开源社区在基座模型之上的二次开发潜力,有助于推动模型生态的多样化。最后,科学任务上的显著增益表明,此类架构在专业领域(如生物、化学)可能具有独特优势,为垂直应用开辟了空间。不过,该模型仍处于发布初期,实际部署效果与长期稳定性有待进一步验证。

© 版权声明

相关文章

堆友更新