松延动力Scalabot发布HERON-CRA模型,机器人可从错误中学习

大模型之家讯 9月15日,松延动力旗下具身智能品牌Scalabot发布HERON技术架构体系下的第二个模型HERON-CRA(Context Reinforcement Action Model)。一周前,该品牌刚发布这一体系的首个世界模型HERON-World Model。

据Scalabot介绍,真实世界中物体会移动、环境会变化、任务会被打断,机器人难免出现动作偏差,因此具备通用操作能力的机器人不仅要知道“应该怎么做”,还需在现实偏离预期时知道“接下来怎么办”。HERON-CRA围绕这一目标构建了Context Expert、RL Engine与Cross-Embodiment Pretraining三项关键能力。

松延动力Scalabot发布HERON-CRA模型,机器人可从错误中学习

其中,Context Expert为机器人建立持续的时空记忆,将历史时刻的空间信息与语义信息编码为结构化的Context Token,并沿时间维度形成连续的4D时空上下文。由此,机器人的行动不再只是对当前画面的瞬时反应,而是建立在对整个任务过程的理解之上。

松延动力Scalabot发布HERON-CRA模型,机器人可从错误中学习

RL Engine则让机器人具备从错误中学习的能力。HERON-CRA引入Value Model,结合任务最终结果与连续时序变化,为每一时刻提供稳定、连续的任务进度判断;同时采用继承基础模型KV值、轻量化Residual RL的方式,专门学习偏差纠正动作。该模型还与HERON-World Model结合,以真实状态为起点生成“想象轨迹”,让机器人能在不增加真实硬件风险的情况下反复尝试,形成“执行—获得结果—判断偏差—学习修正—再次执行”的学习闭环。

松延动力Scalabot发布HERON-CRA模型,机器人可从错误中学习

Cross-Embodiment Pretraining方面,HERON-CRA在预训练阶段融合真实机器人遥操作、仿真数据、UMI及第一视角人类视频等多源数据,覆盖人形机器人、轮式机器人、机械臂、夹爪、灵巧手等本体形态,让模型学习物体运动、空间变化与身体交互的底层规律,从而将能力迁移至新的机器人身体与任务。

Scalabot表示,从HERON-World Model让机器人“学习世界、预演未来”,到HERON-CRA让机器人“记住过去、从错误中学习”,HERON正在从“让机器人完成任务”走向“让机器人持续获得能力”。

原创文章,作者:志斌,如若转载,请注明出处:http://damoai.com.cn/archives/18736

(0)
上一篇 1小时前
下一篇 2024年2月2日 下午4:48

相关推荐

发表回复

登录后才能评论