阿里巴巴的基于位置的服务平台 Amap 表示,其交互式世界模型 ABot-World-0 现在可以在一块消费级图形卡上维持单个连续会话长达 24 小时,并将整个运行过程作为 可寻址记录 发布,而不是仅仅是一个亮点集锦。该页面允许任何人跳转到当天的任何一秒,具有固定的入口点,分别位于六个、十二个和十八个小时的标记处,以及五个完整的草原、沙漠、城市和雪地场景的运行。
这个数字很有价值,因为它突破了一个天花板。交互式世界模型会根据用户的操作逐帧生成视频,因此每个新块都取决于模型自己在之前几帧中产生的帧。小错误会被放大,场景最终会恶化。Amap 表示,大多数此类系统只能维持 30 秒到一分钟。其自身的 7 月 16 日公告 将该模型的运行时间设定为超过一小时。
LongForcing 如何保持运行稳定
Amap 称赞的方法被称为 LongForcing,描述在 技术报告 中,该团队于 2026 年 7 月 21 日发布。通常,构建此类模型的方法是蒸馏:一个较慢的双向教师模型可以一次性关注整个剪辑,并训练一个较快的因果学生模型,该模型仅看到过去的内容,这是实时交互所需的。这种监督通常涵盖短剪辑,因此学生模型学会在几秒钟内看起来很好,并在之后即兴发挥。
LongForcing 扩展了监督范围,直到失败发生的地方。学生模型自行生成长时间的运行,并且具有更长时间上下文的教师模型会监督其后部分内容,在那里预测错误已经有足够的时间积累。报告将其框定为纠正累积的分布偏移和自回归漂移,而不是作为一种记忆机制。模型并不是被要求更准确地回忆早期帧;它被拉向稳定的世界分布,而它正在进行中。
Amap 表示,这在行为中体现出来:模型在运行过程中继续用新场景扩展环境,而不是锁定在它开始的场景中,并且在此过程中没有用户输入新的提示。
所报告的数字涵盖什么
性能包来自团队自己的测量结果。跨优化的低位配置,报告将 ABot-World-0 放在 720p 输出和单个 Nvidia RTX 5090 台式机卡上,每秒最多 16 帧,输入动作和第一帧反映之间的时间约为 1.2 秒,峰值视频内存约为 19 GiB。控制运行在原始键盘输入上,用于场景漫游和第三人称角色移动,具有一个参考角色内存,可以在长时间会话中保持角色的外观稳定。
对于评估,论文报告了 WorldRoamBench 套件的结果,以及扩展的交互式运行,描述结果为具有竞争力的可控性和长时间地平线的世界演化。发布的 24 小时记录添加了可检查性:完整的时间轴可以被逐秒浏览,而不是压缩成一个表格。
报告发布后引起了关注。Hugging Face 的论文页面将其列为 2026 年 7 月 22 日的当日最佳论文,并且自那时起在那里收到了超过 300 个赞同票。
开发人员获得什么
实际的转变是硬件。长时间地平线的交互式生成一直是一个数据中心的工作负载,Amap 的论点是现在一块台式机卡就可以覆盖它,从而降低了没有集群预算的开发人员、工作室和研究小组的进入成本。这对具身 AI 最为重要,政策必须在面对各种环境之前在现实硬件上执行,这是一个领域,吸引了 Google 的 Gemini Robotics ER 2 到 mimic robotics 的视频操作模型在奥迪的工厂地板 的稳定工作。
一切都在项目的 GitHub 仓库 下,以 Apache 2.0 许可证发布,包含推理代码、局部演示和指向 Hugging Face 和 ModelScope 上发布的检查点的指针。这使得 ABot-World-0 与今年其他开源权重发布的项目一起面向开发人员,包括 Thinking Machines Lab 的 Inkling。
除了 24 小时记录外,团队还发布了其 训练数据:30969 个动作条件的视频集,总计 2.74 TB,每个视频集都包含一个 MP4 文件、产生它的键盘动作、字幕和一个稀疏的相机姿势重建场景。发布该语料库允许外部研究人员在同样的材料上训练并测试 LongForcing 是否在他们手中保持有效,而项目的路线图将双向教师模型作为下一个发布的内容。




津公网安备12011002023007号