8月20日,由北京人形机器人创新中心(简称“北京人形”)主办、百度智能云协办的“具身觉醒·慧生万象”具身智能应用创新主题活动举行。北京人形在活动上发布新一代具身大一统模型,推动技术路线从“模块化”迈向“端到端”,并最新发布具身大脑模型Pelican-VL 2.0。
记者从主题活动上获悉,长期以来,具身智能的多项核心能力——视觉语言理解、任务规划、动作执行、世界预测——往往被拆分为多个独立模型、分而治之。这种“模块化”的架构虽然降低了单点实现的难度,却也带来了能力割裂,即模型之间反复调用,误差不断累积,最终导致任务失败,难以在真实场景中随着数据的积累协同进化,突破各自的能力上限。
基于对这一问题的深刻洞察,北京人形在本次大会上正式发布新一代具身大一统模型,推动技术路线从“模块化”迈向“端到端”。所谓“端到端”,其要义并非简单地把多个输出拼接在一起,而是实现共享表示、相互增强、协同进化。
北京人形大模型负责人鞠笑竹表示,统一理解,是将场景、指令、视觉上下文和动作历史映射到共享语义空间;统一推理,是将任务意图、动作选择和未来后果转化为可监督的演化推理过程;统一生成,是在同一个扩散解码过程中联合生成未来视频与底层动作。多维度的输入(文字、图片、视频、动作编码)被统一对齐到共享表征空间,进行统一推理并完成规划,最后端到端的进行视频和动作生成,使“理解—推理—规划—行动”成为闭环,让机器人从“看懂世界”走向“预演未来、精准执行”。
这一技术跃迁也正加速走向落地。北京人形同步推出最新发布的具身大脑模型Pelican-VL 2.0——在已具备较好时空理解、物理感知等能力的基础上,依托强大的后训练基建与强化学习训练,其Agentic能力大幅增强,尤其在长程任务与工具调用等具身关键能力上实现显著提升,真正做到不仅“看得懂”,而且“做得到”。
目前,Pelican-VL 2.0正面向社会全面开放服务,在业界率先实现具身大小脑协同功能的落地与商业化。
此外,北京人形还发布了新一代产品天工Omni,这款面向人形原生具身智能任务全新打造的开放平台,在全身运动控制、灵巧操作、多模态交互等核心能力上实现全面升级,并将底层接口、运动控制框架与具身操作能力全面开放。

