蚂蚁百灵发布LLaDA-Image-Turbo开源图像模型

AIGC行业资讯14小时前发布 zhang
9 0

蚂蚁集团旗下百灵实验室于2026年9月4日发布LLaDA-Image系列开源图像生成与编辑模型,并同步公开模型权重与推理代码。该系列包含LLaDA-Image(Base版)与LLaDA-Image-Turbo(Turbo版),参数规模约6B,采用统一的扩散模型架构,单个检查点即可同时支持文本到图像生成、参考图编辑以及中英文文本渲染,无需额外的编辑骨干网络。

LLaDA-Image-Turbo是本次发布的亮点,它通过Twin-DMD蒸馏技术将采样步数压缩至2至4步,在保持图像质量的同时大幅提升推理速度,适合对延迟敏感的生产环境。Base版则采用50步采样,面向高保真生成任务。两个版本均提供BF16与FP8精度权重,便于不同硬件部署。

在性能上,LLaDA-Image在Qwen-Image-Bench基准上取得领先成绩,英文场景综合得分53.53,中文场景53.38,均达到当前最优(SOTA)水平。模型在自然光照、细节真实感、场景连贯性以及创意海报生成方面表现突出,同时支持指令引导的图像编辑,能忠实保留原图内容并执行精确修改。

训练方法上,LLaDA-Image采用仅图像预训练来学习视觉先验,随后引入配对语言监督和联合生成-编辑训练。这种分阶段策略旨在让模型先掌握视觉结构,再学习语言对齐,从而提升生成质量与编辑一致性。官方计划后续开源训练代码,进一步兑现“完全开放训练配方”的承诺。

此次发布对AI图像生成领域具有多重意义。一方面,开源权重与推理代码降低了开发者使用先进图像模型的门槛,尤其对中文场景的文本渲染能力可能填补现有开源模型的空白。另一方面,Turbo版的低步数推理设计,有望减少对高端GPU的依赖,使实时图像生成在消费级硬件上成为可能。

从产业视角看,蚂蚁集团通过百灵实验室持续加码AI基础模型研发,此次图像模型的发布与其此前在语言模型领域的布局形成互补。开源策略也可能对闭源商业图像模型形成竞争压力,推动行业整体降低API调用成本。不过,模型的实际应用效果仍需社区验证,其训练代码尚未公开,复现与二次开发存在一定限制。

对于AI应用开发者而言,LLaDA-Image-Turbo提供了快速迭代的选项,尤其适合需要批量生成或实时编辑的场景。而对于算力基础设施提供商,高效推理模型可能改变图像生成任务的算力需求结构,从重训练转向重推理优化。

© 版权声明

相关文章

蛙蛙写作