具身智能破局:AWE 3.5如何引爆工业深水区多任务实战

1 阅读

工业「深水区」的自动化革命

走进大型汽车制造商的线束车间,往往能看到与整车总装线截然不同的景象。整车车间明亮整洁,自动化程度极高;而线束车间则拥挤、杂乱,甚至弥漫着汗水与油污的味道。这里长期存在用工荒,许多工人经过一个月培训,在岗时间不足三个月便选择离开。这一场景被业界公认为工业自动化难以啃下的「硬骨头」——即深水区。

然而,在2026年世界人工智能大会(WAIC)上,这一局面被彻底打破。它石智航将一条1:1还原的环形线束流水线直接搬入展馆,展示了一条由多台机器人集群协同作业的全自动化产线。在这条产线上,流水线轮转线束板,每个工位同时处理不同的线束线型。首席科学家丁文超调侃道:现场甚至不敢让机器人持续高强度工作,担心它们效率过高导致物料供应跟不上。

支撑这一高效产线的核心,是它石智航刚刚发布的具身原生基座模型AWE 3.5。这不仅是该模型的一次迭代,更是具身智能领域首个真正打通从预训练到后训练完整范式的原生模型。它标志着具身智能从概念验证正式迈向规模化落地应用的转折点。

AWE 3.5:从单点突破到多任务溢出

将版本命名为3.5,意在传递一个明确信号:希望模型像GPT-3.5那样,在多任务能力上展现出质的飞跃。回顾AWE系列的发展轨迹,3.0版本已在汽车线束场景中确立优势,而3.5版本则试图突破场景壁垒。工业装配、线缆插接、物品收纳等复杂任务,现在均可由同一个模型无缝处理。

在WAIC展台,机器人展现出了惊人的多任务适应性。从整理桌面杂乱物品、打包手机、插拔网线到精细的零件分拣,机器人无需切换参数或加载新模型,仅靠底层基础模型即可应对各种挑战。丁文超形象地将此比作主播带货:只要递过来,就能即刻处理。

更令人震撼的是其背后的世界模型能力。传统认知中,世界模型往往停留在论文架构图和评测数据的层面。而在展台现场,观众通过数据采集夹爪即可与AWE 3.5生成的平行世界互动。当用户捏起积木松手,积木会受重力自然下落;拖拽手机盒时,模型能准确模拟位移与摩擦;甚至连蜡烛微弱的火焰动态也在模型中被忠实还原。

这些物理交互效果并非基于牛顿定律代码或传统碰撞引擎,而是由模型从海量真实数据中自主习得。这种从像素监督向物理规则内化的转变,使得具身智能不再依赖显式的物理公式,而是通过数据驱动理解世界。

突破视频模型缺陷:长时记忆与空间理解

尽管世界模型展现出强大潜力,但传统视频模型存在一个致命缺陷:随着预测时间拉长,物体极易出现消失、变形或彻底蒸发等幻觉现象。究其根源,像素级的监督信号并不鼓励长程物理交互的连续性,导致模型无法在具身训练中保持环境稳定性。

AWE 3.5针对这一问题进行了架构优化。依托Human-centric(以人为中心)数据,模型强化了结构以显式学习长时记忆和长时序空间理解。在长达数分钟的连续交互闭环推演中,模型能够保持环境状态的稳定。这一突破使得后训练过程可以从连续动作序列中切分出多个片段,而无需担心下一秒环境崩塌。

在此基础上,在世界模型中进行强化学习成为可能。传统强化学习依赖真机试错,成本高且周期长。AWE 3.5允许模型在预训练的「脑海」中模拟不同动作的后果,如拉链拉扯时的力度反馈,从而筛选最优策略。这种内源性仿真机制,使得预训练模型成为了自己的仿真器,无需人工搭建复杂的仿真环境。

One Model架构:重构具身大脑

当前行业在VLA(视觉-语言-动作)与世界模型之间路线争论不断。然而,对于实际训练者而言,核心标准在于能否有效优化Action。VLA架构在预训练阶段紧密耦合视觉与语言,但动作模态需在后训练阶段通过SFT接入,导致理论与实操存在先天割裂。而基于互联网视频训练的世界模型,则容易因原有幻觉污染动作策略,或导致视觉理解与动作执行不同步。

它石智航选择了一条更为彻底的路径:从头训练原生具身模型。AWE 3.5采用One Model结构,从预训练阶段起便将视觉、语言、动作等多种模态统一输入。同一套架构通过改变输入输出组合,即可切换不同功能人格:视觉到动作构成Base Policy,负责策略制定;以动作为条件预测未来视觉构成Action Condition World Model,负责环境变化预测。

这种架构的精妙之处在于,模型本身无需更改,仅需调整交互模式即可实现从策略执行到环境模拟的无缝切换。这不仅解决了模态异构问题,更形成了完整的强化学习闭环。正如拉链打包案例所示,模型可在内部模拟毫米级精度的操作反馈,极大加速了策略迭代过程。

数据Scaling与Infra:突破瓶颈的关键

原生模型的成功,依赖于两大基石:超大规模的真实数据与高效的计算基础设施。AWE 3.5基于超过百万小时的Human-centric数据训练,这一量级与主流视频生成模型及自动驾驶数据相当。但数据价值分布极不均匀,低质量、高重复度的数据对模型训练几乎无益。

因此,它石智航将重心从单纯追求数据规模转向提升数据效率(Data Efficiency)。通过智能筛选机制,从百万小时数据中提取高价值片段,成为新的评测维度。当数据规模与效率同步提升后,Scaling的威力得以显现。目前,针对新任务仅需小时级别的数据采集即可完成模型适配。

这一成果验证了One Model架构的前瞻性:先建立通用基础能力,再向具体场景分发。除线束装配外,柔性操作、分拣、检测协同等多个工业场景的验证也在积极推进中。丁文超预测,随着具身Scaling的全面释放,2027年上半年至年中可能出现行业分水岭。

产业落地:从Demo到真实场景的跨越

行业观察显示,具身智能已从前期的「机器人跳舞」等文娱展示,正式进入「机器人真干活」的实用阶段。WAIC展馆的人流数据也印证了这一点,具身智能展区成为全场焦点。各大头部厂商纷纷将机器人送入工厂深水区,在真实环境中进行迭代。

在WAIC展台,汽车精密线束装配演示成为亮点。插孔极小,人工操作尚需眯眼对准,误插风险极高。对于机器人而言,这一任务的难度不言而喻。它石智航通过真实场景的正反馈,不断修正模型迭代方向,而非仅依赖内部Demo。

丁文超强调,具身智能的下一步是赋予系统明确的迭代梯度。这一梯度不能仅靠实验室数据驱动,必须来自真实场景的持续反馈。AI Coding的成功案例表明,垂直应用的深度介入能倒逼模型建立完整的预训练、数据闭环及Harness Engineering体系。具身智能同样需要寻找类似的Killer App,形成稳定可扩展的链路。

未来展望:灵巧手与Research范式重构

尽管成果显著,挑战依然存在。硬件与软件的协同设计(Co-Design)变得尤为关键,特别是灵巧手的作用日益凸显。夹爪虽能解决大部分问题,但在剩余20%的精细操作中,灵巧手成为必选项。它石智航采取Top-Down策略,从人类动作需求反向定义硬件设计,确保数据、模型与硬件的匹配。

随着行业进入Scaling阶段,传统学术研究的空间正在收窄。工业界通过大规模真机闭环验证,逐渐掌握了前沿研究的主导权。Research的定义也在重构,从发表单篇论文转向解决数据采选、Infra设计及系统性工程问题。新入局者需寻找差异化生态位,避免在高度内卷的领域竞争。

丁文超指出,永远不要低估AI模型的能力。行业质疑的焦点不断后移,从「能否动」到「能否干」,再到「能否长序列处理」。只要坚持Scaling路径,并重视真实场景反馈,具身智能必将迎来全面爆发。未来12个月内,机器人将进入更多大众可触达的商业场景,评判标准将回归直观:任务完成度、扩展速度及成本控制。这不仅是技术的胜利,更是工程哲学与数据智慧的双重胜利。