seedance2.5

微软发布 Mage-VL:从零训练的流式多模态模型,视频理解提速 3.5 倍

AIGC行业资讯3小时前发布 zhang
0 0

微软近日在 Hugging Face 平台发布了 Mage-VL,一款面向图像与视频理解的流式多模态基础模型。该模型的核心创新在于其视觉编码器 Mage-ViT 完全从零训练,规模为 4B 参数,而非依赖常见的预训练视觉 Transformer(ViT)。这一设计旨在解决当前视觉语言模型(VLM)在实时流式感知上的效率瓶颈:许多模型擅长复杂的离线推理,但在处理简单、实时的流式输入时却显得缓慢且计算密集。

Mage-VL 借鉴了现代视频编解码器的结构,将视频流分解为锚定帧(I 帧)和预测帧(P 帧)。它保留所有锚定帧的 patch,并仅保留预测帧中编解码器分配较多比特的区域——即包含真实运动和新细节的部分。这种与编解码器对齐的稀疏化方法,可将视觉 token 的消耗减少 超过 75%,同时保持时空上下文,相比均匀帧采样,推理速度可提升 最多 3.5 倍(以墙钟时间计)。

在架构上,Mage-VL 由两个主要组件构成:Mage-ViT 视觉编码器和 Qwen3-4B 语言骨干。Mage-ViT 在共享的 16×16 patch 网格上,根据编解码器导出的时空重要性分配 token,并采用 3D 旋转位置编码。它支持多种编解码器输入,包括传统的 H.264/AVC、HEVC/H.265(通过运动向量和残差能量),以及神经编解码器 DCVC-RT(通过其学习的速率图),且无需改变架构或重新训练。语言骨干则采用 Qwen3-4B-Instruct-2507,通过一个轻量级的两层 MLP 投影器消费 Mage-ViT 的可变长度 token 流,统一处理图像、短/长/超长视频及流式输入。

此外,Mage-VL 采用了一种「系统 1 / 系统 2」的双过程设计,在单一模型内实现主动流式处理。一个轻量级的认知门(系统 1)监控每个滚动编解码器窗口,对常规内容保持静默,仅在检测到值得响应的事件完成时,才调用完整的 VLM(系统 2)进行响应,无需多智能体流水线。

在性能方面,Mage-VL 在多个基准测试上表现出色。在静态图像理解上,它与 Qwen3-VL-4B 相当;在视频理解与空间智能方面则明显领先,例如在 VSI-Bench 上提升 +11.0,在 CrossPoint 上提升 +53.1,在 EmbSpatial 上提升 +5.2,在 QVHighlight 上提升 +22.5。在时间定位任务上,其提升尤为显著:QVHighlight 提升 +22.5,ActivityNet 提升 +17.1,VideoEval-Pro 提升 +24.5。在流式场景中,其认知门在 SoccerNet 流式基准上取得了领先的 TimVal / F1 / ROC-AUC / PR-AUC 分数,并能泛化到真实的 2026 年世界杯转播。

值得注意的是,Mage-VL 的视觉编码器完全从零训练,未使用任何大规模图像-文本预训练 ViT 初始化。这种「编解码器原生」的方法,加上预测性 patch 机制,使得在相同预算下,模型可以训练 8 倍更长 的视频。在原生分辨率扩展方面,Mage-ViT 的性能随 token 预算单调提升,在 676 个 token 时达到峰值(Food-101 上 96.1%,ImageNet 上 86.3%),而固定分辨率的编码器则会饱和或退化。

微软同时发布了两个检查点:microsoft/Mage-VL 是一个统一模型,同时提供图像/视频理解与主动流式门控功能,覆盖所有 Mage-VL 能力;microsoft/Mage-ViT 则是独立的视觉编码器,仅经过 ViT 预训练,未与语言模型进行联合 VLM 训练,可作为数据高效的编解码器原生视觉编码器或用于自定义多模态训练的即插即用 ViT。

从产业视角看,Mage-VL 代表了多模态模型在效率与实时性上的重要探索。通过减少视觉 token 消耗和加速推理,它有望降低视频理解类应用的计算成本与延迟,尤其对需要实时响应的场景(如直播分析、智能监控、自动驾驶辅助等)具有潜在价值。同时,其从零训练视觉编码器的做法,也挑战了依赖大规模预训练 ViT 的常规路径,可能为资源受限的团队提供新的建模思路。不过,该模型目前仍处于发布初期,其实际部署效果与生态支持有待进一步观察。

© 版权声明

相关文章

堆友更新