中国团队PhysBrain 1.5登顶开源物理AI榜单,综合得分逼近GPT-6 Astra

13 阅读

PhysBrain 1.5登顶开源物理AI榜单

2026年9月9日,北京中关村的深度机智公司发布了PhysBrain 1.5物理基座模型。在包含28项任务的公开基准测试中,该模型综合得分达到72.5,成为当前开源阵营中的第一名。更值得注意的是,这一成绩与闭源模型GPT-6 Astra(73.3分)和Gemini 3.6 Flash(73.0分)的差距已缩小到1分以内。

图片

PhysBrain 1.5并非只在个别项目上表现突出,而是在整个物理智能能力链条上都有稳定发挥。它在28项测试中拿下14项开源第一、10项开源第二,覆盖视觉空间感知、多视角理解、具身认知规划、物体可供性识别和视觉轨迹推理等多个维度。这意味着它提供的不是单一的“聪明感知”,而是从环境理解到任务执行的系统性基础能力。

图片

深度机智同步开源了PhysBrain 1.5的2B和8B两个版本。虽然2B版本不参与官方排名,但其66.6的综合得分已经超过了其他所有非PhysBrain的开源模型,包括参数规模更大的Hy-Embodied-VLM-1.0(30A3B,66.0分)和RynnBrain 1.1(9B,63.1分)。这种轻量级版本保留了相当完整的具身理解能力,为开发者提供了更低的部署和二次开发门槛。

图片

物理智能循环:从人类经验出发

图片

PhysBrain 1.5的核心理念是“Physical Loop”——一个包含观察、理解、判断、执行和反馈修正的闭环。深度机智认为,真正的物理智能不是多个独立模块的拼接,而是这个循环能够连续稳定地运转,并根据反馈自我调整。

图片

为了训练这一闭环,团队构建了Ego360人类全景真实数据体系。这套系统通过全景视频记录任务执行时的完整环境,同时捕捉全身姿态、手部运动和任务相关语音,使一段交互不仅包含动作本身,还保留了连续的任务上下文、动作意图和环境变化。

图片

在PhysBrain 1.5的预训练中,所有物理感知监督信号都来自人类交互视频。这种数据选择并非偶然——人类在真实世界中正是通过不断感知情境、产生意图、采取行动并根据结果调整行为来发展操作能力的。深度机智将这一过程视为物理智能的第一性来源。

图片

2026年7月的世界人工智能大会上,深度机智创始人陈凯博士系统阐述了以人类真实交互经验支撑物理通用智能的技术路线。一个月后,国家数据局召开具身智能座谈会,深度机智受邀展示了其人类全景真实数据与情境数采范式,这标志着其技术路径开始获得行业基础设施层面的认可。

文章配图

统一架构下的三大核心能力

图片

PhysBrain 1.5将具身理解、动作生成和未来状态预测三大能力整合进同一个基座模型,避免了传统物理AI系统中“理解模型+动作模型+预测模型”的拼接模式。

图片

具身理解方面,模型不仅“看到”画面,还带着空间结构、物理常识和任务意图去理解场景。它输出的不只是语言描述,还包括结构化的空间坐标与轨迹目标,为后续动作提供关键锚点。在RoboSpatial-Home空间理解测试中,PhysBrain 1.5得分为73.9;在Part-Affordance可操作部位识别中得分为84.0,表明它能准确判断物体的哪些部位可以被操作以及如何操作。

动作生成能力通过Human-as-Humanoid管线实现,从人类视频中学习手腕运动方式并转化为机器人可执行的动作。给定当前画面、任务指令和历史动作,模型能直接生成下一步动作序列。更重要的是,这套动作能力不绑定特定机器人形态,同一模型可适配不同控制频率和结构的机器人,无需单独训练。

未来状态预测则让模型具备前瞻性。在给定当前画面和任务指令后,PhysBrain 1.5能预测1秒后的物理状态,并同时输出RGB图像、深度图和机器人掩码三种模态。这些空间对齐的预测结果共同描述完整未来场景,为动作执行提供预判和纠错依据。

Human-as-Humanoid:连接人类与机器人的桥梁

PhysBrain 1.5面临的一个关键挑战是如何将人类视频中的动作转化为模型可学习、机器人可使用的表示形式。深度机智此前提出的Human-as-Humanoid框架解决了这一问题。

该框架实现了人类行为数据从“可观看记录”到“可训练资源”的转化,使人类交互视频成为动作建模可持续、可规模化的数据来源。在真机验证中,团队使用自研的60自由度拟人体机器人Prime U进行测试,原始示范吞吐量达到传统遥操作的4.8至7.2倍,并在部分任务上实现了从人类数据到真机执行的零样本迁移。

img

这种全栈布局形成了清晰的逻辑闭环:Ego360持续积累人类经验,PhysBrain基座模型以此拓展能力边界,Human-as-Humanoid负责人类动作与机器人动作空间的转换,Prime系列本体则在真实交互中提供验证反馈。数据、大脑与本体被组织在同一条主线上持续演进,构成了难以复制的系统性壁垒。

img

提前一年的战略定力

回看物理AI的发展路径,许多参与者曾默认物理智能只是大语言模型的自然延伸——先将语言能力推到极致,再简单接入动作输出即可。然而GPT-6 Astra在机械臂实验中的表现揭示了这一思路的局限:虽然通用基础模型的提升能转化为粗粒度物理行动能力,但在毫米级精细操作上仍存在明显瓶颈。

深度机智早在2025年10月就发布了《源于人,超越人》技术路线图,明确将“人类学习”作为物理通用智能的核心路径。当时行业对“用人类第一视角数据训练基座模型”尚未形成共识,而2026年PI、NVIDIA、Dyna等机构的集体转向恰恰验证了深度机智的早期判断。

PhysBrain的迭代节奏也体现了工程积累:2026年3月发布1.0版本,9月推出1.5版本,半年一次的高频更新建立了稳定的研发闭环。相比之下,Google DeepMind的Gemini Robotics、Physical Intelligence的π系列、Figure AI和NVIDIA Cosmos 3等全球头部项目虽然也在加速布局,但深度机智在人类学习路线上的先发优势和全栈协同能力已形成关键差异化。

开源推动行业进步

PhysBrain 1.5的意义不仅在于技术指标,更在于其开源策略对整个行业的推动作用。深度机智全面开放了技术报告、2B与8B模型权重以及评测工具包,让更多开发者能在同一套基座上探索物理智能的下一步。

上线仅3天,PhysBrain 1.5就在Hugging Face平台获得了超过3000次下载。这种开放态度降低了物理AI的研究门槛,避免了该领域过早陷入闭源垄断。对于资源有限的学术团队和初创公司而言,一个性能接近顶尖闭源模型的开源基座意味着更多创新可能。

在全球物理AI基础模型的竞争中,中国团队凭借人类学习路线与全栈布局,已经走到了第一梯队。PhysBrain 1.5标志着物理智能的构建方式正在从“拼装专用模块”转向“训练统一基座”,而这一转变的核心驱动力,正是对人类学习本质的深刻理解和工程化实现。