自变量机器人与北京理工大学、清华大学联合发布并开源了HOST框架(Human-to-robot One-Shot Skill AcquisiTion,人类到机器人单样本技能获取)。这一框架让机器人只需观看一段平均时长29秒的人类演示视频,就能在不更新模型参数、不采集新数据的情况下执行全新任务。在涵盖放水果、堆碗、擦盘子、插笔等50项训练阶段从未见过的桌面操作任务测试中,HOST的技能复现成功率达到62%。相关论文已发表在arXiv上(编号2607.20033)。
长期以来,教机器人学会新技能通常需要专业工程师使用昂贵的遥操作设备采集数百条演示数据,再花费数小时微调模型参数,且容易导致机器人“学新忘旧”。HOST的突破在于将学习范式从“动作模仿”转向“结果推理”:机器人不再试图模仿人类的肢体动作,而是观察人类完成任务后的结果状态,再反推自己需要执行的行动序列。这一思路绕开了人机身体结构差异这一难题,将学习目标从“复现过程”重新定义为“达成结果”。
HOST的处理流程分为三步:任务阶段判断、视角迁移和动作反推。首先,机器人观看人类视频时判断当前任务进行到哪一阶段;其次,将人类执行完动作后的画面转化为机器人自身视角和身体结构下的画面;最后,从目标画面反推需要执行的动作序列并执行。这种“先想象结果,再反推动作”的机制赋予了HOST较强的泛化能力,即使执行过程中物品位置被移动,机器人也能根据目标状态重新规划动作。
针对人类与机器人执行速度不同步的问题,HOST采用“按任务进度对齐”策略,通过动态时间规整算法自动建立人类视频帧与机器人操作步骤之间的对应关系。论文数据显示,该方法将对齐误差从基于时钟时间对齐的0.079降至0.006(平均绝对进度差),降低了一个数量级。这意味着普通人无需刻意放慢动作或标准化流程,随手拍摄的视频即可作为教学素材。
HOST的技术底座是一个带有视觉预测功能的级联策略模型,采用“双专家混合架构”。其训练分为两个阶段:首先在193,462条机器人同体轨迹数据上预训练,覆盖229项任务;随后使用5,847条人类-机器人配对演示数据进行微调,实现跨本体迁移。由于推理时不修改模型参数,新技能以推理时输入的形式存在,旧技能以模型权重形式存在,两者互不干扰,因此HOST几乎完整保留了已掌握的技能。论文数据显示,在微调方案学习新技能后,最强基线模型(Wall-OSS+SFT)在旧任务上的表现下降至原来的43%,而HOST几乎不受影响。
HOST的论文、代码和模型权重已全部开源至GitHub和Hugging Face。研究团队表示,开源的目的是将机器人技能获取从依赖专业人员采集数据、反复训练的专业流程,转变为普通人通过一段视频即可完成教学的方式。这一目标直指具身智能行业的核心瓶颈——数据获取成本。目前,头部玩家多走大规模数据采集路线,但遥操作数据采集成本高昂,且长尾场景覆盖不足。HOST提供了一条不同路径:不追求数据规模无限扩张,而是通过算法创新降低单次学习的门槛。
当然,HOST并非没有局限。62%的成功率在单样本学习场景下已属突破性成果,但意味着在近四成场景下机器人仍会失败,距离可靠部署还有差距。目前测试的50项任务以桌面操作类为主,在更复杂的动态场景中表现尚待验证。研究团队在项目主页表示:“HOST是迈向通用机器人学习的第一步,我们希望社区能在此基础上走得更远。”
值得注意的是,2026年以来,具身智能领域呈现开源加速趋势,从谷歌的Open X-Embodiment到小米的Xiaomi-Robotics-1,行业正从“闭门造车”转向“共建生态”。自变量团队选择在项目之初就全面开源,顺应了这一趋势。在Scaling Law仍主导AI叙事的今天,HOST证明了算法创新同样可以大幅降低数据依赖,这或许为具身智能行业提供了一个值得深思的方向:与其无限堆数据,不如教会机器人如何更聪明地学习。




津公网安备12011002023007号