8月6日,阿里巴巴视频生成大模型Wan 3.0正式开启公测,在生成时长、创作方式、参考能力及真实世界还原等维度全面升级。最直观的变化是单次可生成30秒视频,相比此前版本大幅延长,让AI视频从“生成一个镜头”走向“讲述一段完整的故事”,连续运镜、一镜到底等复杂镜头语言得以实现。同时,模型新增智能时长功能,可根据提示词自动推荐合适的视频时长。
Wan3.0的另一项突破是首次支持文档格式输入,在文本、图片、音频、视频四种基础模态之外,新增对doc、xls、ppt、pdf、md等格式的支持。用户上传单个文件或链接(不超过100MB、50页),搭配提示词即可生成教学课件、产品演示、业务汇报等内容。例如,上传一个智能眼镜产品的PPT,就能得到完整的形象片。这标志着Wan3.0正从单纯的视频生成模型,跃迁为信息的表达载体,将结构化文档转化为视觉叙事。
在真实世界还原方面,Wan3.0力求“千人千面”,更敏锐地刻画五官与皮肤细节,人物情绪表达自然克制,微表情与肢体动作联动。在全能参考任务中,角色、道具、声音、空间关系、风格等细粒度维度均可稳定保持。同时,数字化信息的画面审美也同步提升,让图表、数据与界面内容更具质感。此外,视频编辑能力大幅增强,支持修改画面、剧情与台词,但声音质感与文字准确度仍有进步空间。
即日起,Wan3.0在阿里云百炼、万镜一刻、万相官网、千问创作PC端、IF STUDIO和堆友开启公测,并在千问APP灰度开放。API价格按分辨率区分:480P为0.3元/秒,720P为0.6元/秒,1080P为1.2元/秒,API接口将于近期全量开放。
从产业视角看,Wan3.0的发布体现了视频生成模型从内容创作工具向生产力工具的转变。支持文档输入意味着AI视频可直接服务于办公、教育、营销等场景,降低了视频制作门槛。对AI应用层企业而言,这类能力有望提升内容生产效率,并带动对底层算力的需求。不过,模型在声音和文字准确性上的不足,也提示当前技术仍有完善空间。




津公网安备12011002023007号