GPT-6 Astra 控制机械臂画金门大桥,通用大模型能当机器人大脑吗?

0 阅读

一台 150 美元的机械臂,画出了金门大桥

最近一段视频火了:一台售价约 150 美元的 SO-101 桌面机械臂,在 GPT-6 Astra 的指挥下,一笔一划画出了一幅红蓝相间的金门大桥。

飞书文档 - 图片

这不是预设轨迹回放。Astra 先分析图像,决定从哪里落笔;再通过摄像头实时观察笔尖位置,动态调整动作,直到整幅画完成。整个过程没有人类干预,也没有专门针对绘图任务微调过模型。

文章配图

Sam Altman 看完直接转发:“给我也来一个!”

文章配图

这事听起来像网友整活,但它背后藏着一个更严肃的问题:通用大模型能不能直接当机器人的“大脑”?

文章配图

从看视频到动手做:Physical ICL 成了

飞书文档 - 图片

卡内基梅隆大学(CMU)的 Wenli Xiao 做了个更直观的实验。他先录下一段人类完成新任务的视频——比如把瓶盖拧到瓶子上——然后把这段视频直接喂给 Codex,再让 GPT-6 Astra 控制机械臂复现同样的动作。

飞书文档 - 图片

结果一次就跑通了。

飞书文档 - 图片

Wenli 把这种能力称为 “physical in-context learning”(physical ICL)。过去大模型能从几段文字或代码示例里临时学会新任务,现在人们发现,这种能力搬到物理世界也行得通:看一遍人类怎么做,就能让机器人照着做出来。

飞书文档 - 图片

这省去了传统机器人开发中最耗时的部分——为每个任务单独写控制逻辑、调参数、反复试错。如果模型真能稳定复现这种能力,那机器人编程的门槛会大幅降低。

飞书文档 - 图片

不只模仿,还能重建真实世界

飞书文档 - 图片

另一批人走得更远。Lingxiao Guo 把真实机器人操作的多视角视频和动作数据交给 Astra,让它自己处理相机标定、三维场景重建和物体物理参数估计,最后生成一个能在 MuJoCo 里运行的仿真环境。

这个 real2sim 系统不只是“看起来像”,而是能准确模拟接触力、摩擦和运动约束,支持后续的动作回放和策略训练。这意味着,Astra 不仅能控制机器人,还能帮机器人“理解”它所处的物理世界。

X 上还有人把 Astra 接到更复杂的硬件上。Dmytro Hrybov 在 MuJoCo 中给它配了一台 Kinova Gen3 七轴机械臂和 Shadow Hand 五指灵巧手,任务是画毕加索那只著名的鸽子。

这比画金门大桥难多了。机械手不仅要握稳铅笔,还得协调手指与笔之间的摩擦力、控制笔尖与纸面的接触压力,同时保持手腕姿态稳定。Astra 居然也完成了。

实机测试:95% 成功率 vs 10% 成功率

如果说以上还在仿真或简单任务里打转,RoboCurve 的实机测试就更有说服力了。

他们把 GPT-6 Astra 接到两只真实的 I2RT YAM 机械臂上。Astra 每一步能看到顶部相机和两只手腕上的三个视角,加上机械臂自身的关节状态。然后它直接输出两只末端执行器的目标位姿:x、y、z、yaw、pitch、roll,以及夹爪开合状态。底层的逆运动学(IK)模块再把这些目标转换成具体关节角度。

测试任务很简单:把桌上的红色积木抓起来,放进旁边的碗里。

结果:20 次尝试,成功 19 次,成功率 95%。作为对比,同样条件下 Fable 5.1 只成功了 8 次。

但换一个任务,情况立刻变了。当任务变成“把一块圆形拼图准确嵌入对应凹槽”时,Astra 的成功率骤降到 10%——20 次只成功 2 次。

问题出在“最后一毫米”。Astra 能找到拼图、抓住旋钮、移动到目标附近,却很难完成精确对准和插入。稍微偏一点角度,零件就卡住;接触力稍有偏差,下一步动作就失败。

通用模型 vs 专用机器人基础模型

过去几年,机器人圈一直在问:“谁会成为机器人领域的 OpenAI?”

Physical Intelligence 和 Skild 是这条路上的明星。前者推出 π 系列模型,把视觉、语言和动作统一建模,希望从海量具身数据中学会通用操作能力;后者喊出 “Any task, any robot, one brain”,试图用一个模型驱动所有形态的机器人。

他们的核心思路很清晰:既然语言有 foundation model,机器人也需要在大量机器人轨迹上训练自己的基础模型。

但 Astra 的出现,让这个问题有了意外答案。Amazon Alexa 的首席科学家 Zeeshan Zia 直接说:“机器人领域的 OpenAI,可能就是 OpenAI 自己。”

关键在于,Astra 并没有走专用路线。它没用机器人数据从头训练,而是靠通用大模型已有的知识——关于物体、空间、因果、人类行为的理解——来指导动作。

这其实呼应了 OpenAI 早年的探索。2018 年,他们用 Dactyl 让 Shadow 灵巧手在真实世界旋转物体、解魔方,研究 sim2real 迁移、遮挡处理、多自由度控制。但后来团队解散了,原因之一是:机器人数据太贵、太慢,没法像互联网文本那样大规模获取。

如今,OpenAI 绕了一圈回来。它先把模型在语言、代码、视觉、Agent 上做大,积累了丰富的世界知识;现在要解决的,是如何把这些知识稳定地转化为身体动作。

Sam Altman 最近明确表示,OpenAI 会做人形机器人,也会探索其他形态。而真正的核心,仍然是那个“让机器人工作的大脑”。

Astra 怎么控制机器人的“身体”?

目前来看,Astra 并不直接控制每个电机。

在 RoboCurve 的设置中,它只负责高层决策:“手应该去哪里?” 输出的是末端执行器的目标位姿和夹爪状态。底层的 IK 和控制器负责解决 “每个关节怎么动?”

这是一种典型的分层架构:Astra 做感知、推理、规划;传统机器人栈做实时、稳定的低层执行。

英伟达前研究科学家 Yu Xiang 认为,这正是下一步的关键方向——如何把最先进的 AI 模型真正接入 manipulation(操作),而不只是停留在任务拆解和工具调用层面。

但也有人尝试让 Astra 更深入。有人让它直接输出 Unitree Go1 四足机器人的关节目标,以 50Hz 频率控制行走。实验确实跑起来了,但因为 Astra 推理速度跟不上实时需求,物理模拟必须在每次调用之间暂停。最终,250 次推理只换来约 5 秒的行走。

这说明:Astra 能决定“下一步该怎么动”,但还不能接管毫秒级的底层控制。

“最后一毫米”仍是硬骨头

Astra 的优势集中在“头脑”部分:理解场景、判断目标、规划路径。但一旦进入高频反馈、精细接触、力控制阶段,它的短板就暴露了。

Physical Intelligence 最近专门研究“最后一毫米”问题。他们的实验显示,让通用模型拿起螺丝刀很容易,但要快速准确对准一颗 M3 螺丝,仍需在线强化学习微调。网线插入、电源线固定、扎带扣合等任务,也都卡在类似的精细接触环节。

这揭示了一个现实:最强的大脑,需要匹配足够好的身体。

目前的机器人硬件在重复精度、力控响应、传感器融合等方面仍有局限。即使 Astra 知道“应该插进去”,但执行机构的微小误差、摩擦变化、延迟,都可能导致失败。

开放问题:通用模型能否终结专用路线?

Astra 的表现让人兴奋,但它还没完全回答那个根本问题:机器人是否还需要专门的基础模型?

一种可能是,通用大模型 + 分层控制架构,足以覆盖大多数日常任务。对于抓积木、倒水、开门这类中等精度操作,Astra 已经接近可用。

但对工业装配、精密维修、微创手术等高要求场景,专用模型+在线学习+高精度硬件的组合可能仍是必需。

更关键的是,Astra 的能力依赖于高质量的视觉输入和稳定的底层控制器。如果摄像头模糊、光照变化、或者 IK 解算失败,整个系统就会崩溃。而专用机器人模型往往在训练时就见过各种噪声和失败案例,鲁棒性更强。

所以,短期内更可能的路径不是“取代”,而是“融合”:用通用大模型提供高层语义理解和任务规划,用专用策略或传统控制处理精细执行。

OpenAI 如果真要造机器人,大概率也会走这条路——用 Astra 当大脑,但搭配专门为物理交互优化的身体和底层控制栈。

结语:大脑有了,身体还得跟上

GPT-6 Astra 的出现,证明了通用大模型在机器人控制上的巨大潜力。它不需要专门训练,就能完成从绘图到抓取的多种任务,甚至在实机测试中击败了部分专用系统。

但这不意味着机器人基础模型路线就此终结。相反,Astra 的局限恰恰凸显了物理交互的复杂性——理解世界容易,精准操作难。

未来几年,我们可能会看到两种路线并行:一边是 Physical Intelligence、Skild 等公司继续打磨专用机器人基础模型;另一边是 OpenAI、Google、Meta 等把通用大模型更深地嵌入机器人系统。

而最终胜出的,或许不是某一种模型,而是那个能把“最强大脑”和“最可靠身体”结合起来的方案。