机器人困于Demo?讯飞新解:补上本体认知,打破VLA局限

0 阅读

在2026年的世界人工智能大会具身智能展区,一个普遍存在的现象引发了行业深思:尽管硬件供应链日益成熟,机器人的动作执行依然显得迟缓且谨慎。这种“慢”,并非源于电机性能的极限,而是出于对出错率的恐惧。当环境发生微小变化或物体属性改变时,现有算法往往导致动作变形,迫使开发者将速度调至安全档以维持演示效果。这一现象揭示了具身智能当前面临的核心困境:机器人的“大脑”尚未真正跨过实用化的门槛。

针对这一痛点,由科大讯飞杰出科学家潘嘉领衔的新公司爻方智能提出了截然不同的技术视角。他们认为,当前主流的视觉-语言-动作(VLA)模型并非终极解决方案,而新兴的世界模型(World Model)虽然引入了预测机制,却遗漏了关键的一环——“本体认知”。这一观点直指行业技术路线的深层缺陷,即机器人虽然能预判环境变化,却缺乏对自身身体能力边界的清晰认知,导致规划与执行之间出现断裂。

VLA模型作为过去几年的主流架构,其优势在于直接将视觉感知和语言指令映射为动作输出,具有见效快、部署门槛低的特点。然而,其本质是一个“即时反应系统”,仅关注当前时刻的最优解,缺乏对动作后果的长远推演。这就好比驾驶员看到红灯知道刹车,却无法预判雨天路滑可能导致的失控风险。这种短视性使得VLA在处理长时序、高复杂度的物理交互任务时显得力不从心,难以应对真实世界中充满不确定性的动态场景。

为了弥补VLA的不足,行业开始转向世界模型,试图通过预测未来状态来指导当前行动。英伟达等头部企业大力推崇的Physical AI理念,正是基于这一逻辑。然而,爻方智能指出,现有的世界模型架构存在两个显著缺陷。首先是“可执行性鸿沟”,即视觉预测生成的未来画面可能在物理上无法实现,导致误差在从视觉到动作的转换过程中累积放大。其次是更为隐蔽的“本体认知缺失”,模型能够精准预测球的落点,却不知道自身机械臂的运动极限是否足以完成接球动作。这种“知彼不知己”的状态,是造成机器人动作僵硬、泛化能力差的根本原因。

在此背景下,爻方智能发布的iFLYTEK-Embodied-Omni技术报告提出了一种全新的架构思路。该方案并未完全抛弃VLA,而是将其与视频生成模型(VGM)相结合,构建了理解、预测、动作三位一体的统一多模态具身基础模型。其中,VGM负责在行动前预演未来视觉状态,使机器人具备“先想后动”的能力;而核心的创新在于将逆运动学求解纳入训练任务,强制模型通过目标位置反推关节运动,从而在端到端的学习中建立对本体结构的深刻认知。

这种设计巧妙地将“认识世界”与“认识自己”融合在一起。与传统方法将本体状态仅作为输入信号不同,爻方智能将本体认知作为一道必答题,要求模型在预测未来的同时,必须计算出每个关节的具体转动角度。这种联合训练机制有效避免了视觉预测与动作执行之间的脱节,使得生成的动作不仅在视觉上合理,在物理上也具备高度的可执行性。正如潘嘉所言,以往的模型无法通过任务去认识本体,而新架构则让模型在完成任务的过程中自然习得身体的直觉。

除了架构上的创新,大脑与小脑的协同机制也是提升机器人响应速度的关键。传统机器人控制通常采用串行模式,即高层规划完成后才交由底层执行,这种信息单向传递方式容易导致误差累积和响应延迟。iFLYTEK-Embodied-Omni采用了实时协同架构,VLM(视觉语言模型)和VGM构成高层大脑,负责任务规划和未来预测;AGM(动作生成模型)作为低层小脑,负责将抽象目标转化为具体动作。两者通过共享的多模态自注意力机制进行实时交互,如同羽毛球运动员在判断球路的同时调整身体姿态,实现了规划与执行的无缝衔接。

在数据策略方面,爻方智能采取了不同于行业常规的做法。面对真机数据稀缺的现状,他们并未盲目追求大规模量产以收集数据,而是强调在跨过实用门槛后再进行规模化部署。其训练数据配比显示,近一半的数据来源于空间推理、感知与任务规划等“具身大脑数据”,包括2D/3D轨迹、定位及物体指向等信息。这些数据无需依赖昂贵的真机采集,却能高效提升模型的空间感和规划能力。其余数据则包括带有动作标注的机器人轨迹、无动作的人类操作视频以及通用VQA数据,形成了多元化的数据喂养体系。

为了验证这一架构的有效性,团队采用了分步训练策略。首先分别对VLM、VGM和AGM进行专项训练,确保各模块具备扎实的基础能力;随后进行联合微调,使三者在一个统一框架内实现对齐与协同。评测结果显示,该模型在LIBERO-Plus零样本基准测试中平均成功率达到89.6%,在RoboTwin 2.0双臂协同基准中更是取得了超过93%的高分,且在环境扰动增加的情况下表现更加稳定。这证明了双核大脑在应对复杂、非结构化环境时的强大泛化能力。

从产业落地的角度来看,这一技术突破并非孤立存在,而是科大讯飞多年技术积累的必然结果。从早期的语音识别到如今的具身智能,讯飞始终致力于解决技术从实验室走向实际应用的“最后一公里”问题。潘嘉团队在语音领域积累的工程化经验,特别是在噪音环境下的鲁棒性优化和客户导向的产品打磨能力,被完整迁移到了机器人领域。这种对实用性的极致追求,使得爻方智能的技术路线更加注重稳定性和可靠性,而非仅仅追求榜单上的高分。

目前,该技术已通过科大讯飞控股子公司安徽聆动通用的工业具身平台进行验证。聆动通用负责整合大脑、小脑与本体的全链路自主可控技术,并拥有相应的硬件本体。真机测试表明,更换了新架构大脑的机器人能够在工业场景中完成复杂的连续操作,证明了该技术路线的可行性。随着资本市场对具身智能的关注点从概念炒作转向收入、订单及复购率,能够提供稳定、高效解决方案的企业将在下一阶段竞争中占据优势。

爻方智能的名字寓意深远,“爻”代表《易经》中阴阳变动的最小单元,象征着二进制代码的起源;“方”则寓意在变幻莫测的世界中坚守方寸之地。这种“变中求方”的理念,恰如其分地诠释了具身智能的发展哲学:在算法架构不断演进的同时,始终紧扣物理世界的真实规律与本体认知的核心需求。对于整个行业而言,这不仅是一次技术路线的修正,更是对机器人智能本质的一次重新审视。只有当机器人真正理解自己的身体与周围的世界,才能从精心布置的Demo中走出来,成为人类生活中得力的助手。