WAIC2026:它石智航AWE 3.5如何引爆工业具身智能深水区?
工业「深水区」的破局者:当机器人不再只是表演
走进传统汽车制造厂的整车车间,映入眼帘的是高度整洁、几乎全封闭的自动化流水线。然而,一旦转入线束车间,画风骤变:空间拥挤、环境嘈杂,且充斥着大量重复性高、精度要求严苛的人工操作。这里曾是工业自动化的「禁区」——线束柔软易变形、插孔微小需极高精度,工人流失率极高,培训周期长且效率低下。这种被称为工业「深水区」的痛点,长期困扰着制造业升级的步伐。
2026年世界人工智能大会(WAIC)上,它石智航通过一条1:1还原的环形线束流水线,给出了颠覆性的答案。多台机器人集群在无需切换模型或参数的情况下,协同完成插接、分拣、收纳等复杂任务。现场甚至出现「料跟不上手」的盛况,首席科学家丁文超调侃道:「我们不敢让它一直干活,怕给料用完了。」这一现象背后,支撑这一切的核心引擎,正是其刚刚发布的具身原生基座模型——AWE 3.5。
从「单点突破」到「全能选手」:AWE 3.5的多任务实战
回顾AWE系列模型的发展轨迹,3.0版本已在特定场景下验证了可行性,而3.5版本则标志着能力的全面溢出。它石智航将工业装配、柔性操作、零件分拣等异构任务统一纳入同一个基础模型中。这种设计不再依赖传统的大模型「特化版」思路,即针对不同场景训练独立模型,而是通过「One Model」架构,让模型像人类一样具备通用认知能力。
在WAIC展台,观众目睹了令人震撼的「劳模」机器人集群:整理桌面、打包手机、插拔网线,任务之间无缝切换。更关键的是,这种多任务能力并非简单的指令叠加,而是基于对物理世界深层理解的自然涌现。模型能够实时理解物体属性、空间关系及操作逻辑,从而在执行过程中动态调整策略。这种通用性不仅提升了部署效率,更降低了工业场景下的边际成本,为大规模落地铺平了道路。
世界模型的内化:从被动预测到主动仿真
在具身智能领域,「世界模型」常被视为论文中的概念,但AWE 3.5将其转化为可交互的实体。展台设置了平行世界互动环节,用户通过数据采集夹爪与虚拟物体互动时,能感受到真实的物理反馈,如重力下落、摩擦力、碰撞反弹等。值得注意的是,这些反馈并非来自预设的物理引擎代码,而是模型从海量真实数据中学习到的物理规律。
这一能力的突破在于解决了视频模型长期存在的「长程连贯性」缺陷。传统视频模型在长序列预测中容易出现物体消失或形变幻觉,因为像素级监督无法有效捕捉物理交互的连续性。AWE 3.5通过强化人类中心(Human-Centric)数据训练,显式学习了长时记忆与空间理解,确保在数分钟的连续交互中环境状态的稳定。这使得模型不仅能「看」,还能在内部「模拟」,从而为强化学习提供了理想的训练场。
原生架构重构:One Model与内部仿真闭环
行业曾长期争论VLA(视觉-语言-动作)与世界模型路线的优劣。VLA架构往往在预训练阶段耦合视觉与语言,动作模态需在后训练阶段通过SFT接入,导致理论与实践之间存在断层。而直接移植互联网视频模型至具身领域,又易引发幻觉干扰动作策略的问题。
它石智航选择了更彻底的路径:从头构建具身原生模型。AWE 3.5在预训练阶段即融合视觉、语言、动作多模态,形成统一的One Model结构。该架构的精妙之处在于其灵活性:通过改变输入输出组合,模型可切换为「Base Policy」负责策略制定,或转为「Action Condition World Model」负责预测环境变化。两者交互形成完整的强化学习闭环。
以拉链操作为例,传统方法需依赖真机反复试错,成本高且风险大。AWE 3.5则先在模型内部进行「脑海模拟」,推演不同力度下的结果,筛选最优策略后再指导真机。这种「模型即仿真器」的能力,大幅缩短了迭代周期,验证了预训练建立通用物理交互、后训练实现自我强化的范式可行性。
数据效率与Scaling释放:从「堆量」到「聪明」
AWE 3.5的训练基石是超百万小时的Human-Centric数据。这一量级与顶级视频生成模型及自动驾驶系统相当,但具身数据的核心价值在于「质量」而非单纯数量。它石智航通过优化数据基础设施,实现了从「更多」向「更聪明」的转变,将数据效率(Data Efficiency)作为关键评测维度。
随着Scaling能力的全面释放,新任务的适应周期被压缩至小时级。丁文超指出,预训练已构建起扎实的通用基础,使得模型能够通过少样本快速迁移至新场景。这一突破预示着具身智能正从「单场景闭环」走向「多场景规模化复制」。除线束装配外,柔性操作、分拣检测等场景已在验证中,标志着行业正式进入「机器人真干活」的阶段。
行业分水岭前瞻:从Demo到量产的跨越
随着WAIC上200多家具身智能企业的聚集,行业热度空前,但泡沫与实质并存。丁文超预测,2027年上半年至年中将出现行业分水岭。届时,评判标准将从「能否完成演示任务」转向「能否在多场景中实现可靠、规模化落地」。
这一转变类似于自动驾驶的发展历程:早期比拼路线演示,后期决胜「开城速度」与量产能力。对于具身智能而言,这意味着企业需构建包含数据采集、模型训练、工程部署、客户反馈在内的完整闭环。只有真正进入工厂「深水区」,在真实环境中接受长期、稳定、不间断运行的考验,才能验证技术的真实性能。
灵巧手与工程化:最后的硬核挑战
尽管模型能力显著提升,但硬件协同仍是关键瓶颈。丁文超强调,灵巧手的成熟将是具身智能的重要里程碑。相较于夹爪能解决80%的问题,剩余20%的精细操作往往依赖灵巧手的高自由度与触觉反馈。它石智航采取「Top-Down」策略,从人类动作数据反推硬件设计,力求在数据、模型与硬件间找到最佳平衡点。
此外,推理算力与实时性的矛盾也需要工程化手段化解。通过感知与动作生成的异步解耦,大模型同样可实现高频动作输出。这表明,随着技术演进,推理速度不再单纯依赖模型大小,而是取决于系统架构的优化。
重新定义Research:工业界的主导权转移
随着Scaling时代的到来,具身智能的Research范式正在发生深刻变化。学术界传统上注重新颖性算法,但在大规模数据与基础设施面前,许多「Trick」的重要性相对下降。工业界正通过系统性工程挑战——如数据筛选、Infra设计、后训练流程——掌握更多话语权。
它石智航内部取消了专门的「预研」岗位,全员称为工程师,体现了研究与工程的深度融合。这种模式要求团队在缺乏现成论文参考的情况下,依靠第一性原理进行大规模实验验证。新入局者若想突围,需寻找差异化生态位,如专注通用世界模型或全尺寸人形方向,避免在已内卷的桌面级任务中消耗资源。
结语:永远不要低估模型
回顾具身智能的发展,质疑声从未停歇:从「不会动」到「不能干活」,再到「无法长序列操作」。每一次质疑的「球门」后移,都伴随着技术实际的跃进。AWE 3.5的发布,不仅验证了具身Scaling的力量,更展示了原生模型在理解物理世界方面的巨大潜力。
未来12个月内,机器人将加速进入更多商业场景,尽管家庭应用仍有Gap,但工业领域的深度渗透已不可逆转。对于从业者而言,保持对模型能力的敬畏,坚持在真实场景中打磨产品,将是穿越周期、赢得未来的关键。它石智航的行动表明,具身智能的下半场,属于那些能将技术扎实嵌入产业肌理的长期主义者。