大模型之家讯 9月1日,李飞飞、吴佳俊等学者联合发布TrAct论文,提出以视觉轨迹作为通用翻译层,打破世界模型与机器人动作控制之间的跨模态壁垒。TrAct跟踪夹爪上7个固定网格顶点和图像平面25个均匀采样点,将不同机器人本体的低维动作指令统一映射为跨本体通用的视觉轨迹,再交由世界模型进行预演和打分。在自建LIBERO-INTEGRAL基准上,TrAct平均成功率达55%,较基线π0.5的27%翻倍;在真实Franka Panda机器人上5个未见任务平均成功率76%,π0.5仅49%。该工作还融合了76K条机器人遥操作数据和约150K条人类第一视角操作视频进行预训练,证明人类视频无需动作标注即可直接参与机器人模型训练。