seedance2.5

实测智象未来vivago R1:长视频编排能力成新护城河

AIGC行业资讯3小时前发布 zhang
0 0

7月18日,在2026世界人工智能大会(WAIC)现场,智象未来正式发布全球首个无限时长内容创作多模态智能体vivago R1,并宣布已完成C轮融资,近三个月累计融资超20亿元人民币。这一发布标志着AI视频生成从单点素材生成向长链路创作编排的转变,而实测显示,其核心竞争力在于模型聚合之上的Agent编排能力。

vivago R1的母公司智象未来(HiDream.ai)成立于2023年3月,总部位于北京,创始人兼CEO梅涛曾任职微软亚洲研究院高级研究员、京东高级副总裁,并于2025年当选ACM Fellow。公司定位为“全球唯一同时支持文本、图像、视频、3D四个模态的基础模型厂商”,此前开源过文生图模型HiDream-I1。vivago R1是智象面向专业创作者的智能体平台,其前身Vivago Video Agent于2026年5月在Product Hunt上线,曾获当日产品榜第一,但当时单条视频输出时长封顶3分钟。两个月后,R1将目标提升至无限时长。

R1的核心优势被概括为“长、长、稳”:无限时长、长任务思考、高稳定生成。官方称,其内容有效可用成功率提升至85%左右,远高于行业平均水平。技术架构上,R1是一个技能驱动的编排Agent,拥有17个功能技能,覆盖视频、图像、电商、社媒等垂类,其中cinematic-story-director是最成熟的旗舰技能。底层视频生成采用“自研模型+聚合第三方模型”的混合模式,根据其官网llms.txt文件,聚合了Sora 2、可灵v2.6 Pro、Veo 3/3.1以及自研Vivago 2.0(现已更名HiDream 2.0)。前端用户只能看到能力选项(如“拍个电影故事”),无法感知具体模型,模型路由完全在服务端完成。

实测中,作者设计了一部“叶什尔查姆风格”的土耳其山寨科幻烂片,以考验R1在荒诞、多镜头、跨场景长叙事下的一致性。成片时长1分11秒,叙事、镜头切换流畅,人物、道具、风格从头到尾几乎不崩,廉价美学得以保留。Agent日志显示,其运行了cinematic-story-director技能,流程为:理解任务→故事初稿→视听剧本→拆分场景→美术指导→生成锁定参考图→文字分镜→视频提示词→逐场景生成→拼接成片。一致性主要来自“锁定参考图+逐段参考图生视频”的工程编排,而非模型长程记忆。唯一瑕疵是41秒处有数秒画面发黏,以及背景轻微漂移,但整体完成度极高。

长视频编排正成为行业共识。2026年6月,伯克利哈斯商学院专栏文章指出,模型和编排框架正在商品化,纯软件Agent的护城河最弱,护城河正从模型迁移至物理体验。资本市场上,Cursor于2026年6月被SpaceX以600亿美元收购,Manus曾接近以20亿美元被收购,OpenRouter也在洽谈收购。这些案例表明,聚合是手段,编排出的体验才是产品核心。对于AI视频产品,真正的价值在于Agent编排层能否做出别人做不出的、可验证的东西。

当前主流AI视频产品时长多在秒级至两分钟:谷歌Veo 3.1单段约8秒,OpenAI Sora 2约60秒(消费端已于2026年4月关停),快手可灵3.0号称“导演级”可达两分钟。若R1能稳定产出五分钟以上且连贯的成片,将填补市场空白。技术上,长片生成的主流做法是编排现有SOTA模型并跨镜头缝合,因为单段模型受物理限制,一次稳定生成时长有限。R1选择编排层方向已被行业证实,但方向对不等于做得好,实测验证了其可行性。

R1的发布和融资进展,反映了AI视频赛道从模型竞赛转向编排能力竞争的趋势。对于投资者而言,关注点应从底层模型参数转向产品能否通过编排解决长视频一致性痛点,这或许是新的护城河所在。

© 版权声明

相关文章

堆友更新