近日,考拉悠然与头部机器人厂商签署战略合作协议。双方将围绕具身大脑研发及重点行业展开合作,推动具身智能从技术验证进一步走向真实场景与规模化应用。

  一边是世界模型能力在全球评测中的持续验证,一边是“大脑+本体”产业协同进一步深化。考拉悠然正在从模型能力突破,加速走向具身智能真实世界应用。

  01 从单视角到多视角,世界模型迎来更全面的考验

  现有世界模型评测多聚焦单视角视频,但真实机器人操作并不是单一视角下的视觉预测问题,而是需要头部与双腕相机共同感知全局任务、局部交互与物体状态变化。TriWorldBench因此将三路同步视频纳入统一评测,基于RoboTwin 2.0设置50项双臂操作任务、500个测试片段,并从六大维度、19项指标综合考察多视角一致性、任务执行、物理规律与视觉生成能力。模型不仅要让每个画面逼真,还要保证三个视角中的物体状态、动作时序和任务进程严格一致,对世界模型的综合预测能力提出了更高要求,也吸引了众多海内外高校、科研机构和企业团队参与竞争。

  面向这一挑战,考拉悠然联合同济大学研发的悠然无界多视角世界模型BWM-Pro。给定头部与双腕的初始画面及动作序列,模型即可同步推演三个视角下的未来变化,且不同视角中的机械臂动作、物体状态与交互时序保持一致。

  02 三大维度领跑,BWM-Pro的优势在哪里?

  三个视角,对得上

  机器人操作时,头部与腕部镜头的视野差异较大。模型需要把全局场景与局部动作联系起来。这组成绩,体现了BWM-Pro在跨视角预测上的优势。

  围绕任务,跟的准

  在任务对齐维度,BWM-Pro以87.48分位列第一,其中Semantic Alignment达到92.24分,排名第一;JEPA Similarity达到95.59分,排名第二。

  给定一项操作任务,未来画面需要呈现相应的动作和状态变化。

图1:任务对齐维度指标

  动作轨迹,预测更准确

  在运动质量维度,BWM-Pro以49.87分位列第一,其中Trajectory Accuracy以62.41分夺冠。

  机械臂往哪里移动、沿着怎样的路径接近物体,都会影响后续操作。

图2:运动质量维度指标

  此外,BWM-Pro在视觉质量维度排名第三,Image Quality与Aesthetic Quality两项指标均进入前三。面向抓取放置、物体堆叠、倾倒、双臂交接、开关操作与工具使用等多类任务,BWM-Pro将腕部视角的接触细节与头部视角的全局变化协同起来,不论是简单还是复杂场景,都展现出兼顾精细动作控制与多视角一致性的预测能力。以下为部分任务演示:

  03 技术攻坚,BWM-Pro凭什么实现突破?

  从“生成三段视频”到“推演同一个世界”,关键在于让双臂动作、局部交互与全局场景遵循一致的演化过程。BWM-Pro围绕具身结构、多尺度时序与跨视角空间关联三个层面展开架构设计,将动作的精细控制与场景的协同预测纳入统一框架,探索面向双臂操作的多视角世界建模。

  创新一|具身结构先验,重构动作与视觉的控制关系

  BWM-Pro将机械臂与摄像机的物理对应关系转化为模型内部的控制结构:头部视角接收双臂动作轨迹,左右腕部视角仅直接接收同侧轨迹。这一设计不再将完整动作广播至所有视角,而是在动作编码前明确控制归属。让机器人本体结构参与预测,从源头限制无关动作的直接注入,为双臂操作建立分工明确的动作—视觉映射。

  创新二|多尺度动作驱动,贯通精细交互与连续演化

  BWM-Pro围绕动作序列与视频演化的时间结构,构建粗细协同的双路径控制机制:细粒度分支通过交叉注意力读取完整轨迹,保留逐时刻动作信息;粗粒度分支将成组动作与视频潜在时间步对齐,通过自适应调制引导连续运动变化。两条路径共享具身路由,让精细动作信息与成组时序信息共同参与生成,将局部交互与连续演化纳入统一建模。

  创新三|几何感知协同,推动多视角世界的一致推演

  BWM-Pro在共享生成主干的同时保留三路独立视觉表征,并通过逐层、同时刻的跨视角交互建立场景联系。模型结合时空—视角联合位置编码,在训练中引入由相机几何构建的视锥约束,引导不同镜头中空间上可能关联的区域交换信息。跨视角协同由此从无差别的特征混合,走向空间关系引导的联合预测,在保留局部视角特性的同时,加强同一操作的多视角一致性。

  从具身结构约束动作,到多尺度时序驱动演化,再到空间关联引导协同,BWM-Pro将“动作可控”与“世界一致”贯穿于同一架构,推动多视角预测从各自成像走向共同推演。

  04 牵手头部机器人厂商,让世界模型走向真实应用

  考拉悠然此次与头部机器人厂商签署战略合作协议,围绕具身智能生态展开全方位合作:在技术侧共研面向真实场景的具身大脑,在业务侧联合开拓重点行业,推动具身智能从技术验证走向规模化商业落地。

  此次牵手被视为具身智能产业链“大脑——本体——场景”三层协同的一次关键握手。考拉悠然将以自研悠然无界世界模型与多模态大模型为底座,提供机器人的认知、推理与任务规划具身大脑的能力;头部机器人厂商将以覆盖四足、轮足、人形三大形态的本体平台与全栈运控能力,提供可靠的物理执行载体。双方希望通过优势互补,共同构建开放、可复制、可进化的具身智能生态。

  未来,双方将继续深化产学研协同,围绕更复杂、更长程的机器人操作推进悠然无界世界模型的落地应用,让前沿研究成果逐步转化为具身智能的实际应用能力。

来源:日照新闻网