1.5B参数挑战具身智能极限:小模型为何能进第一梯队?
在具身智能领域,行业曾长期陷入一个误区:认为参数量是衡量模型智能水平的唯一标尺。然而,随着模型从实验室走向真实的物理世界,这种观点正面临严峻挑战。真正的考验不在于模型在封闭数据集上的评分有多高,而在于它能否在算力受限、网络不稳定甚至完全离线的复杂环境下,稳定、快速地完成物理操作。面壁智能近期发布的MiniCPM-Robot系列模型,正是对这一行业痛点的直接回应。通过极具创新性的轻量化设计与工程优化,这两个仅含1.5B和0.9B参数的模型,在主流VLA评测中冲入第一梯队,标志着具身智能进入了一个追求“高效能比”的新阶段。
小参数背后的技术突围:从“看”到“记”的进化
MiniCPM-RobotManip的核心突破,首先体现在对机器人“记忆力”的增强。在传统VLA模型中,决策往往基于当前帧画面,这种瞬时判断机制导致机器人在执行长序列任务时容易“断片”。例如,在需要连续按压按钮或层层组装三明治的任务中,模型若无法记住已执行的动作步骤,极易出现动作停滞或重复。MiniCPM-RobotManip通过引入历史观测与动作序列的联合判断机制,显著提升了上下文记忆能力。在专门考察上下文记忆的RMBench评测中,其得分约为53分,远超接近随机水平的π0.5模型(约10分)。这种能力使得机器人能够像人类一样,通过回顾前序步骤来推断当前任务进度,从而确保长任务的完整执行。
此外,该模型在推理效率上的表现同样惊人。在H100显卡环境下,其单次决策延迟约为120毫秒,仅为竞争对手π0.5的一半。对于机械臂而言,毫秒级的延迟差异直接决定了动作的流畅度与协作效率。更快的响应意味着更少的等待时间,这对于需要多机协作或高频交互的工业场景至关重要。MiniCPM-RobotTrack同样遵循轻量化路线,基于MiniCPM4-0.5B构建,在单目标跟踪、多人干扰及模糊目标跟踪等真实场景中,均取得了开源方案中的最优结果,甚至在模糊目标跟踪上大幅超越闭源模型TrackVLA++。
视觉压缩与流式计算:破解算力瓶颈的关键
为何在参数大幅缩减的情况下,性能反而得到增强?这得益于面壁在多模态处理上的底层架构创新。机器人执行动作需处理来自多个摄像头的高频视频流,若将每一帧画面转化为大量视觉Token,计算量将呈指数级增长。MiniCPM-RobotManip采用了视觉Token压缩策略,剔除背景纹理等非关键信息,仅保留任务相关的核心特征,从而大幅降低单次推理的数据负荷。
更关键的是其采用的流式计算机制。传统方法在处理新帧时需重新计算历史所有信息,而流式计算允许模型复用已处理的历史状态,仅需对新输入进行增量计算。这一机制类似于观看连续剧时直接接着上一集进度播放,而非每集都从头开始。通过这种方式,模型能够以极低的计算成本保留长程历史记忆,既避免了算力资源的浪费,又增强了任务执行的连贯性。这种设计思路表明,具身智能的核心竞争力正从单纯的规模扩张,转向对单位算力效率的深度挖掘。
端到端推理与离线运行:打破环境限制
MiniCPM-RobotTrack的另一大亮点在于其端到端的统一处理架构。它将视觉画面、自然语言指令和控制决策整合在同一模型中,无需额外部署独立的目标检测或跟踪模块。这种精简架构不仅降低了系统复杂度,还使得模型能够直接运行在机器人本地算力上,如宇树Go2 Edu的原装计算单元。实测显示,该方案在本地可实现5Hz以上的稳定运行,端到端延迟约180毫秒。
更为重要的是,这种本地化处理赋予了机器人极强的环境适应性。在电梯、地下停车场等弱网或无网环境中,云端推理往往中断,而本地模型仍能基于摄像头画面和预存指令完成目标识别与运动控制。演示视频中,机器狗在无网络信号下依然能准确识别并跟随指定目标,证明了端侧部署在隐私保护、数据安全及业务连续性方面的巨大优势。这种“断网可用”的能力,是具身智能进入商业落地的关键门槛。
PhyAI框架与数据闭环:工程落地的加速器
模型的先进性最终需通过工程框架转化为生产力。伴随模型发布的PhyAI推理框架,由明体科技联合北京邮电大学、北京大学共同研发,旨在解决具身模型部署中的适配难题。该框架通过CUDA Graph优化与定制融合算子,在RTX 5090等硬件上实现了显著加速,相较于官方仓库,对π0、π0.5等模型的加速比分别达到2.85倍、1.82倍和2.28倍。在MiniCPM-Robot系列上,帧率从10.12Hz提升至36.77Hz,极大缩短了从模型训练到硬件部署的路径。
同时,面壁构建了自进化的数据闭环管线。针对真实世界中频发的长尾场景,如目标快速遮挡、多人交叉行走等,系统通过仿真与真机测试自动收集失败案例,利用专家策略进行纠偏并回流至训练集。这种“错题本”式的迭代机制,使得模型能够在不断暴露薄弱环节的过程中持续进化,逐步提升对罕见场景的鲁棒性。
结语:回归物理世界的务实主义
具身智能的最终价值,不在于榜单上的分数,而在于能否在工厂、仓库、展厅等真实场景中稳定工作。面壁智能通过MiniCPM-Robot系列与PhyAI框架,展示了一条“先通后专”的技术路径:先通过多模态基础模型建立对物理世界的通用理解,再通过特定任务数据与工程优化实现领域专精。
1.5B和0.9B的参数规模,并非能力的妥协,而是对实际应用场景的深刻洞察。在算力成本、响应速度与操作稳定性之间找到平衡点,才是具身智能走向大规模商用的正道。随着乐聚机器人、吉利汽车等合作伙伴的加入,这一轻量化、端侧优先的范式有望在更多工业与生活场景中落地,推动AI真正从“云端大脑”延伸为“物理手脚”,实现从数字智能到物理智能的跨越。