智源FlagOS完成Qwen3.8-2.4T在9款芯片的Day0适配

AIGC行业资讯5小时前发布 zhang
1 0

阿里巴巴近日开源了其超大规模MoE(混合专家)模型Qwen3.8-2.4T-A95B,与此同时,智源研究院的Flag OS社区宣布已完成该模型的Day0多芯片适配。这意味着,在模型发布当天,开发者即可在包括平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、隧原在内的9家AI芯片上,基于Flag OS统一开源技术栈获得开箱即用的部署方案。

据智源方面介绍,此次适配针对不同芯片提供了BF16、FP8、INT8等多种精度版本,并完成了精度对齐与部署验证。Qwen3.8-2.4T-A95B是阿里巴巴开源系列中规模最大、能力最强的一代,首次将Qwen-Max级别的模型开放出来。该模型总参数达2.4万亿,激活参数为95B,为纯文本模型,在编程、专业工作、科研、长程智能体任务等能力上显著提升,支持通过reasoning_effort调节推理深度,并具备preserve_thinking以保留历史推理。其原生上下文长度达262,144 tokens,可扩展至1,010,000,提供BF16/FP8权重,兼容vLLM、SGLang等主流推理框架。

在Coding Agent相关基准测试中,Qwen3.8-Max相比前代Qwen3.7-Max有明显提升:Terminal Bench 2.1得分从74.5升至86.6,SWE-bench Pro从60.6升至67.7,接近Opus 4.8的69.2;Paper Bench从64.8升至93.0,超过Opus 4.8的80.3。这些数据表明,新一代模型在代码智能体任务上已具备与国际领先模型竞争的实力。

此次适配的核心挑战在于模型参数规模比Qwen3.5-397B扩大了6倍。为了让已部署的主流AI芯片能够运行如此庞大的模型,Flag OS技术栈新增了面向多款AI芯片的统一INT8量化支持。通过Flag OS-Compressor多芯片模型量化工具链,团队实现了从FP8/BF16原生权重到INT8的两条量化压缩路径,并完成了量化推理算子在多款芯片上的适配。经评测,量化迁移后的权重在多种AI芯片上与英伟达原生CUDA FP8版本对照,误差平均分偏差均在对齐区间内,保证了模型质量。

这一进展是Flag OS自今年2月首次开展MiniCPM4.5-o模型多芯片Day0适配以来的又一次实践。截至目前,Flag OS已累计完成来自7大头部模型团队、12款主流开源模型、覆盖多达10款芯片的跨芯Day0适配。这向AI芯片与大模型产业验证了:基于统一、开放的系统软件栈,实现前沿模型“一次开发、多芯快速适配”已具备规模化落地能力。

对国内云厂商、智算中心和新兴Token算力服务商而言,每次大模型发布都意味着新的迁移与适配工作。不同芯片的适配链路相对独立,往往需要重复投入大量工程资源。Flag OS的Day0适配将新模型从发布到多芯可用的周期压缩至24小时以内,使中小型算力服务商能够基于国产芯片快速上线推理API和MaaS服务,无需维持完整的底层适配团队。目前,腾讯云HAI社区、超算互联网等多个云平台已将Flag OS适配的模型纳入其容器镜像中心,开发者可直接拉取镜像部署至云端加速卡,这表明Day0适配正从技术验证走向云服务交付。

此外,Flag OS还致力于让存量算力持续承接前沿模型。通过量化、算子优化和跨芯适配,Flag OS-Compressor已支持W8A8量化,将权重和激活由BF16压缩至INT8,显著降低显存占用与访存压力,解决了当下80%以上存量AI算力不支持FP8的问题。针对不同代际的国产AI芯片,Flag OS进一步优化了量化后的权重规模、单卡显存、卡数、内存带宽及并行通信方案,使存量算力有机会继续运行最新的超大规模MoE模型。对智算中心等重资产场景而言,这有助于延长设备服役周期、提高利用率,缓解因模型快速演进带来的硬件更新压力。智源方面强调,其目标并非让旧硬件获得与新一代硬件相同的性能,而是在部署条件、模型精度和性能表现均可验证的前提下,为国产算力持续承接前沿模型提供可持续经济的选择。

© 版权声明

相关文章

堆友更新