1
世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型
全球首个将触觉融入世界动作模型的AI,基于50万小时人类视频训练,实现感知与动作闭环。
全球首个将触觉融入世界动作模型的AI,基于50万小时人类视频训练,实现感知与动作闭环。
首次定义具身动作表征的ImageNet基准,揭示人类视频数据可驱动机器人泛化学习。
LARYBench (Latent Action Representation Yielding Benchmark),一个指引从大规模的视觉数据学习到通用的隐式动作表征的系统化评测基准。实验结果表明:在动作泛化和控制精度上,通用视觉模型的表现均显著优于专门为具身智能设计的动作专家模型,具身动作表征…