视频号
    标题 摘要 内容
    详情

    近日,宇树科技(Unitree Robotics)正式发布新一代通用人形机器人基础模型UnifoLM-WLA-1.0,模型参数规模 6B,主打 World-Language-Action(世界 - 语言 - 动作)一体化框架,聚焦人形机器人空间感知、具身推理与全身协同操作能力,多项评测刷新开源具身模型 SOTA 水平,并同步开放模型权重、代码与训练数据集,面向行业开发者开源共享。


    UnifoLM-WLA-1.0 基于大规模多模态感知理解数据与面向交互的世界建模训练,训练数据包含约 2500 小时高质量真机交互数据、500 万 + 具身推理样本,打通感知、空间推理、场景变化预测与动作生成链路,实现机器人从看懂环境、理解任务到全身协同执行的端到端能力。模型核心亮点为单模型统一支持 64 项机器人任务,涵盖 54 项桌面精细操作以及 10 项全身移动操作,包含叠衣物、收纳餐具、电池充电、铺床、倒垃圾、衣物投放洗衣机等生活化场景任务,突破传统机器人模型单任务适配的局限。


    在末端执行器兼容性方面,UnifoLM-WLA-1.0 无需重新微调,即可适配二指平行夹爪与多款五指灵巧手,跨硬件泛化能力突出。其具身推理底座 UnifoLM-ER-1-4B 在 16 项多模态感知基准测试中,拿下 7 项开源模型最优成绩,在空间理解类任务上部分指标超越 GPT-6 Astra 等闭源模型,整体性能对标国际头部具身大模型,显著提升人形机器人对三维空间、物体位置、交互后果的预判能力。


    传统视觉语言模型更多停留在 “看懂画面”,而 WLA 框架的核心创新是增加世界建模能力,机器人在执行动作前可以预测交互带来的场景动态变化,再输出全身协同动作指令,真正形成具备物理常识的 “具身大脑”。该模型已在宇树 G1 人形机器人真机上完成验证,实现机械臂、末端手爪与下肢移动协同作业,兼顾桌面精细操作与移动操作两类场景,为人形机器人走进家庭、商用服务场景打下底层算法基础。


    宇树科技表示,人形机器人产业竞争已经从硬件本体,逐步转向具身基础模型与机器人生态竞争。本次开源 UnifoLM-WLA-1.0,旨在降低国内人形机器人开发者的算法门槛,开放真机数据集、模型权重与工程代码,鼓励科研机构、创业团队、企业基于该底座开展二次开发,加速通用人形机器人落地。


    据介绍,UnifoLM 系列模型持续迭代,此前已推出 UnifoLM-VLA-0 视觉语言动作模型。未来宇树将持续完善 UnifoLM 系列世界模型,扩充任务场景与真机数据,优化全身协同、长时序任务规划能力,持续开源相关成果,共建国产人形机器人具身智能开源生态。