Mistral 在 Hugging Face 上发布了 Mistral-Large-3-675B-Instruct-2512-NVFP4,这是其大型模型家族中 Mistral Large 3 指令版本的后训练激活量化权重。该模型总参数 675B、激活参数 41B,属于细粒度混合专家(MoE)架构,并配有 2.5B 的视觉编码器,从零开始使用 3000 块 H200 训练。此次上线的 NVFP4 版本由 llm-compressor 工具生成,是 Mistral 与 vLLM、Red Hat 团队合作的成果。
从部署角度看,这次量化最直接的意义是硬件门槛的下降。官方说明,Mistral Large 3 的 FP8 版本需要单节点 B200 或 H200 才能运行,而 NVFP4 版本可以在单节点 H100 或 A100 上部署。对于仍以 H100、A100 为主力算力的企业而言,这等于把一款前沿级开源模型的本地部署路径打通了。不过官方也提示,NVFP4 在 64k 以上长上下文场景会出现性能下滑,此时建议改用 FP8 权重;在 B200 上则能观察到明显加速,视觉数据集上有轻微回退,可能与校准主要基于文本数据有关。
模型能力方面,Mistral Large 3 Instruct 支持图像理解、数十种语言(含中文、英文、法文、西班牙文、德文、意大利文、葡萄牙文、荷兰文、日文、韩文、阿拉伯文等)、系统提示词遵循、原生函数调用与 JSON 输出,上下文窗口为 256k,采用 Apache 2.0 开源许可,允许商用与非商用场景下的使用和修改。官方列出的典型用途包括长文档理解、日常 AI 助手、智能体与工具调用、企业知识工作以及通用编程辅助。
官方同时给出了部署建议:采用客户端—服务器配置,系统提示词需明确环境与用例并说明如何调用工具;生产环境采样温度建议低于 0.1;工具集合应保持精简,避免数量过多拖累模型;启用视觉能力时,图片宽高比尽量接近 1:1,过窄或过宽的图片应先裁剪。使用上推荐搭配 vLLM 0.12.0 及以上版本,并会自动安装 mistral_common 1.8.6。对于没有 B200 的用户,vLLM 提供回退到 Marlin FP4 的选项,可在 A100、H100 上运行量化模型,虽无速度提升,但仍能获得显存收益。
官方也坦承了局限:该模型并非专用推理模型,在严格推理任务上可能不敌专门的推理模型;在多模态任务上落后于视觉优先的模型;且由于体量与架构原因,在资源受限或大规模场景下高效部署存在挑战。此外,官方提醒在 32k token 以内的任务上,NVFP4 版本相比原版指令模型应无明显性能退化,超出该长度则可能出现小幅下降。
对关注 AI 产业的读者来说,这条发布的关键词是「量化」与「部署门槛」。675B 级 MoE 模型被压缩到单节点 H100/A100 可跑,意味着前沿开源权重对存量算力的适配性在增强,企业本地化部署的硬件选型与推理成本结构可能随之调整;同时,与 vLLM、Red Hat 的协作也显示开源推理栈与模型厂商之间的协同正在加深。
津公网安备12011002023007号