详情
近日,宇树科技正式开源 UnifoLM-WLA-0,这是 UnifoLM 系列面向通用人形机器人操作的视觉 - 语言 - 动作(VLA)基础模型,推动大模型从纯图文理解,升级为具备物理常识的人形机器人 “具身大脑”,为人形机器人通用操作落地提供开源基座。
传统视觉语言模型擅长文本与图像理解,但难以适配真实物理空间交互,存在空间感知不足、动作泛化能力弱等痛点。UnifoLM-WLA-0 基于 Qwen2.5-VL-7B 基座持续预训练,深度融合文本指令、二维图像与三维空间信息,强化空间几何感知与语义对齐能力。模型构建全链路动力学预测数据,能够预判物体交互变化,大幅提升物理场景下的任务泛化能力。
真机验证结果显示,UnifoLM-WLA-0 依托单策略即可稳定完成 12 类复杂机器人操作任务。模型配套覆盖机器人操作场景的多任务数据集,包含目标检测分割、任务层级拆解、3D 目标识别、空间推理、运动轨迹预测等多维度样本,补齐传统大模型在机器人物理交互层面的数据短板。
本次开源同步开放模型权重、代码与配套数据集,降低科研机构、机器人开发者开展具身智能算法研发的门槛。开发者可基于 UnifoLM-WLA-0 快速开展人形机器人操作策略开发,快速验证复杂场景下机器人抓取、物品整理等实操任务。
宇树表示,UnifoLM-WLA-0 是其在通用人形机器人具身智能领域的重要探索。未来 UnifoLM 系列模型将持续迭代,进一步强化全身移动操作、长任务规划能力,持续开放模型、数据集与开发工具链,共建人形机器人开源生态,加速通用人形机器人从实验室走向真实场景。
