doubao-pc

1.5TB 压到 214GB:腾讯混元 Hy4 preview 轻量版发布开源,异构设备可联合推理

AIGC行业资讯15小时前发布 zhang
3 0

9 月 1 日消息,腾讯混元团队今日宣布推出 Hy4 preview 轻量版,将 Hy4 preview 的模型权重从接近 1.5TB 压缩至约 214GB。

1.5TB 压到 214GB:腾讯混元 Hy4 preview 轻量版发布开源,异构设备可联合推理

注:Hy4 preview 是腾讯于 8 月 28 日发布并开源的新一代 MoE(混合专家)大语言模型,总参数量 770B(7700 亿),激活参数 49B,上下文长度达 100 万 Token。

此次压缩依托两项核心技术:其一是 Sherry 稀疏三值量化算法,将路由专家层权重压缩至平均 1.25 比特;其二是 MIX-STQ1_0 混合精度策略,依据校准数据逐层决定每层的量化位宽,敏感层保留较高精度(2.06 比特 IQ2_XXS),不敏感层采用更激进的 STQ1_0(1.31 比特)。

1.5TB 压到 214GB:腾讯混元 Hy4 preview 轻量版发布开源,异构设备可联合推理

两种技术结合,使模型在主流任务上表现稳定 —— 长文理解几乎与原始 BF16 模型持平,多轮长上下文检索基本在同一水平,数学能力仅小幅回落。MCP Atlas 得分从 83.7 微降至 83.2,SWE-Bench multi 从 82.9 降至 81.3。

1.5TB 压到 214GB:腾讯混元 Hy4 preview 轻量版发布开源,异构设备可联合推理

BF16 即 bfloat16 浮点格式,是 AI 训练中常用的低精度数值格式;bpw(bits per weight)指每个权重参数平均占用的比特数,数值越低压缩率越高。

1.5TB 压到 214GB:腾讯混元 Hy4 preview 轻量版发布开源,异构设备可联合推理

在异构设备联合推理方面,腾讯混元与 prima.cpp 合作验证了一项新方案:在一台配备单张 4090 的笔记本与一台四卡 A4000 服务器(合计 80GB 显存、64GB 内存、分属两个局域网)上,通过 prima.cpp 的异构调度将 MoE 层拆分分配,使 214GB 的轻量版模型达到 1.02 token/s 的推理速度,比笔记本单机 offload 快约 6 倍。

1.5TB 压到 214GB:腾讯混元 Hy4 preview 轻量版发布开源,异构设备可联合推理

轻量版模型已上线 Hugging Face 和 GitHub 平台,支持 llama.cpp、vLLM、SGLang 等主流推理框架。

© 版权声明

相关文章

堆友更新