扔掉遥控器,才是具身智能真正落地的标志
遥控不是原罪,而是过渡
如果你看过最近的人形机器人比赛,大概率会注意到一个细节:不少机器人背后站着一两个人,手里攥着遥控器。去年的机器人半程马拉松甚至被调侃为“遥控车大赛”——每台机器人都需要两三名工程师跟着跑,有人背电池,有人拿手柄。

这种画面很容易让人产生怀疑:这些号称“智能”的机器人,是不是只是高级遥控玩具?

但事情没那么简单。遥控的存在,恰恰暴露了当前具身智能的真实水平,也揭示了它正在经历的关键进化阶段。

赛场上的自主率正在提升

第二届机器人半程马拉松已经明确区分“自主导航组”和“遥控组”。前者成绩按1.0计算,后者则乘以1.2的加权系数——相当于人为增加时间惩罚。最终夺冠的是荣耀齐天大圣队的“闪电”,一台完全自主奔跑的机器人,用时50分26秒,不仅比上届冠军快了近两小时,还打破了人类选手57分20秒的纪录。

更值得注意的是,今年40%的参赛机器人选择了全自主模式,前三名全部来自这一组别。赛事组织方显然在用规则推动技术方向:真正的进步,不是跑得多快,而是能不能自己跑。

变化背后是技术迭代。去年很多机器人靠摄像头识别跑道,容易跑偏;今年不少队伍在头部加装激光雷达,赛前先对“冰丝带”场馆建模,比赛时通过雷达与地图匹配,实现厘米级定位。这种感知能力的提升,让机器人真正具备了独立应对复杂环境的基础。
当然,像100米障碍、400米跨栏这类高难度项目,仍允许使用遥控,但同样要接受1.2倍的时间惩罚。规则设计者很清楚:允许过渡,但不能纵容依赖。
遥控 ≠ 玩具
即便那些标榜“自主”的机器人,往往也需要操作员按下启动键,或在关键时刻切换模式。这是否意味着它们仍是“提线木偶”?
答案是否定的。传统遥控车的动作完全由人控制——你按前进,它就走;你打方向,它就转。而人形机器人完全不同。操作员通常只发出高层指令,比如“向前跑”“绕过那个锥桶”“开始举重”。至于如何迈腿、调整重心、协调几十个关节的微小动作,全部由机器人内部算法实时决策。
你可以把操作员看作足球队的主教练,只负责布置战术,具体怎么踢、怎么过人、怎么射门,全靠球员临场发挥。人类的手速再快,也不可能同时操控几十个毫米级的瞬时动作。因此,所谓“遥控”,其实是在“任务层”下达目标,而非“执行层”干预细节。
目前市面上多数人形机器人处于L2初期(参考何小鹏提出的L1-L5分级)。宇树科技的G1标准版售价9.99万元,仅支持展示和基础遥控,属于L1-L2之间;而面向高校和开发者的EDU版价格跳到20万~40万元,才具备二次开发和部分自主能力。这说明,真正的智能远未普及。
泛化能力是最大瓶颈
为什么不能彻底扔掉遥控器?核心问题在于泛化能力不足。
王兴兴提出过一个“双80%”标准:把机器人放到80%的陌生场景中,通过语音或文字指令,它能顺利完成约80%的任务。达到这个水平,才算真正进入通用化阶段。
现实情况是,机器人在固定场景中经过充分训练后,成功率可以接近100%。但一旦环境稍有变化——地面材质不同、光线变暗、障碍物位置偏移——任务失败率就会明显上升。这种“脆弱性”正是莫拉维克悖论的体现:AI擅长下棋、推理等抽象任务,却难以掌握人类婴儿就能学会的走路、抓取等物理交互。
硬件躯壳其实十多年前就已基本成型,后续只是优化。真正卡脖子的是“大脑”——如何让上层意图(比如“端杯水过来”)无缝转化为底层几十个关节的协同运动。这中间的鸿沟,是未来3到5年最关键的攻关方向。
遥控其实在喂养AI
有趣的是,遥控本身正在成为推动自主进化的重要工具。
每一次人为操作,其实都在产生真实世界的行为数据。第二届机器人运动会就积累了2500小时的操作记录,覆盖12个应用场景、44项作业和百余项技能。这些真机数据将成为训练下一代具身大模型的“养料”。
一个生动的例子是天工Omni的“娇羞”摆臂动作。研发团队澄清,这个捂脸般的姿态既非预设脚本,也非遥控指令,而是机器人在自主训练中“学出来”的步态。这说明,数据驱动的自我学习循环已经开始形成。
评测标准正在重塑产业
赛事规则的变化,也在倒逼厂商从“秀Demo”转向“真能力”。明年第三届运动会计划大幅增加场景赛项,“是否全自主”很可能成为硬性评分指标。这意味着,那些只能在实验室里完美表演的机器人,将被观众“祛魅”。
丢掉遥控器,从来不是一个可选项,而是具身智能走向商业化的必经之路。它不是加分项,而是及格线。
王兴兴预测,快则2到3年,慢则5到10年,机器人可能迎来自己的“ChatGPT时刻”——当泛化难题被攻克,遥控器自然会退出历史舞台。到那时,我们不再需要告诉机器人“怎么走”,只需说“去哪”;不再需要示范“怎么做”,只需说“做什么”。
在此之前,遥控器的存在不必回避。它不是骗局的遮羞布,而是成长的拐杖。