发生了什么
宇树科技于2026年9月10日发布UnifoLM-WLA-1.0,并宣布全面开源。这是一个视觉—语言—动作(Vision-Language-Action,VLA)基础模型,参数量6B。与此前多数面向单一任务或单一本体的机器人策略模型不同,宇树的目标是用同一套权重覆盖桌面操作与全身移动操作,并在不同机器人与不同末端执行器之间迁移先验知识。
- 数据规模:约2500小时高质量真机数据,来源包括宇树开放数据集与BitRobot-HIW-500;具身推理部分使用超过500万条训练样本。
- 任务覆盖:真机评测覆盖64项任务,其中10项为全身移动操作、54项为桌面操作,支持平行夹爪与两种灵巧手。
- 技术路线:先由UnifoLM-ER-1完成空间理解与具身推理,再通过光流提取未来场景动态区域并用VQ-VAE编码为离散token,构建以交互为中心的世界模型,最后由MMDiT动作专家生成连续动作轨迹。
- 开放范围:官方页面显示代码、模型与数据集资源将开放,当前部分资源处于即将发布状态。
为什么重要
具身智能长期受限于数据成本与泛化能力。互联网上可以低成本获取海量图文与视频,机器人的动作数据却必须依赖真实硬件、真实场景与大量操作时间。宇树本次的工程重点在于把统一动作空间拆分为末端执行器位姿、末端执行器关节与下肢关节三部分,并分别用量化模型离散化,使不同本体、不同末端执行器的数据可以进入同一训练体系。如果这一路径成立,机器人数量的增长就不必然导致模型数量的线性增长。
从产业格局看,这一步也回应了外部质疑。宇树以硬件起家并已完成上市,长期被质疑在模型侧进展滞后,其招股书显示计划投入约20.22亿元用于智能机器人模型研发。开源基础模型有助于把公司定位从硬件制造向「硬件+具身AI平台」推进。
尚待观察
需要区分官方自评与独立验证。宇树公布的评测表格中,UnifoLM-ER-1-4B在ROBOVQA、EGO-PLAN2、REF SPATIAL BENCH、PIXMO-POINT、BLINK等多项指标上领先开源模型,但部分竞品分数取自其官方技术报告或API调用测试,口径不完全一致;跨本体迁移能力目前主要在宇树自有平台上验证,第三方机器人本体上的复现结果尚未公开。此外,代码与权重的完整开放时间表仍需跟踪。
「一个模型驱动多种任务、多种末端执行器。」——宇树科技官方对UnifoLM-WLA-1.0的概括

