具身ICL崛起:上下文Scaling如何重塑机器人学习范式?
近年来,大语言模型(LLM)凭借In-Context Learning(ICL)能力实现了任务泛化的重大突破——仅通过输入中的几个示例,无需参数更新即可执行新任务。这一范式如今正被迁移至具身智能领域,催生出一种全新的机器人学习路径。2026年8月,Skild AI发布S1模型,仅需观看一次长达10分钟的任务演示视频,即可在未见过的环境中完成复杂操作;几乎同期,Generalist AI推出的GEN-1.5也强调其One-Shot Learning能力,支持人类示范到机器人执行的端到端迁移。这些进展标志着,上下文长度与质量正成为具身智能Scaling的新维度。

然而,将ICL从纯文本领域迁移到物理世界并非简单复制。机器人面对的是高维、异构、时序连续的多模态输入:每秒数十帧的视觉观测、本体状态、关节力矩、触觉反馈,以及可能的语言指令。更重要的是,真实任务具有非马尔可夫性——当前决策高度依赖历史动作轨迹。例如,组装一个玩具可能需要先识别零件A,再抓取零件B,最后对准卡扣。若模型无法记住“已抓取A”,后续动作将完全失效。这种复杂性使得具身ICL的技术门槛远高于语言模型。

在此背景下,国内创业公司可可矩阵(COCO Matrix)提出了一条差异化路径:将ICL能力前置到预训练阶段,而非仅作为后训练的附加功能。其核心理念是“强理解,轻生成”——通过构建任务条件驱动的动态视觉表征,让模型在理解阶段就精准提取与动作相关的信息,从而大幅简化后续动作生成模块。这一思路直指当前VLA(Vision-Language-Action)模型的痛点:传统视觉编码器输出的嵌入向量包含大量与任务无关的冗余信息(如桌面纹理、背景装饰),迫使动作头必须具备极强的特征筛选能力,导致模型臃肿且泛化受限。
可可矩阵的解决方案是引入“条件隐空间”。不同于固定Embedding,该表征会根据当前任务意图(如“抓杯子”或“拧螺丝”)动态调整信息提取策略。在抓取任务初期,模型侧重语义识别(确认目标为杯子);接近执行阶段,则聚焦几何属性(位置、深度、轮廓)。这种机制已在深度估计、实例分割、人体姿态预测等八九类视觉任务中验证有效,部分性能逼近专用模型。更关键的是,当动作头参数量压缩至60M时,其表现仍优于1.1B参数的传统方案,证明了“理解先行”的可行性。
但实现高效ICL仍面临三大技术瓶颈。首先是多模态对齐难题。视觉与语言虽可通过海量网络数据预训练对齐,但触觉、听觉、本体感知等模态缺乏大规模标注数据,难以融入统一表征空间。其次是长上下文处理。机器人需在有限显存下持续保留关键历史信息,而非简单扩展窗口长度。可可矩阵认为,真正的Long Context应是一种流式记忆机制:模型基于任务理解动态筛选、压缩KV Cache,确保数小时前的有效经验仍可被调用。这借鉴了LLM中的Sparse Attention与Routing技术,但需适配具身场景的时序特性。
第三大挑战在于数据体系缺失。尽管ICL降低了对任务全覆盖数据的依赖,但高质量基础数据仍是前提。当前行业严重缺乏人机教学、实时纠偏、协同作业等交互数据。例如,当人类手把手纠正机器人动作时,如何同步记录人的语言指令、手势轨迹、机器人的状态反馈及错误时刻?这类数据尚未形成采集标准,却对训练Self-Correction能力至关重要。可可矩阵计划将其作为下一阶段重点,定义新型人机交互数据协议。
值得注意的是,ICL的成功还需配套评估体系的革新。传统指标如“任务成功率”已不足以衡量学习能力。可可矩阵提出“第一次成功平均耗时”作为新标准——即机器人观看一次示范后,需多少次尝试才能首次完成任务。对于简单抓取,目标应是单次成功;对于叠衣服等复杂任务,则期望学习周期接近人类培训时间。这种动态评估更能反映实际部署中的教学成本。
创业团队的选择亦折射出范式转型的迫切性。可可矩阵创始人高宇翔曾参与傅利叶人形机器人的全栈开发,亲历VLA数据Scaling的边际效益递减。他观察到,即使投入百万级成本采集数据,模型仍难以泛化至新场景。这促使他与专注机器人泛化的学术伙伴共同创业,聚焦ICL底层架构创新。团队刻意保持小规模,强调“智力密度”而非人力堆砌,反映出对技术本质的深刻认知。
长远来看,具身ICL若能跑通,将彻底改变机器人部署逻辑。一台机器人在某地学会的新技能,可通过上下文共享快速复用于其他设备,形成分布式知识网络。而人类只需提供一次示范或口头指导,即可完成技能传递,大幅降低使用门槛。当然,这条路仍需跨越感知鲁棒性、动作安全性、跨域迁移等多重障碍。但正如LLM时代所证明的:当Scaling律在新维度上成立,智能的涌现往往超乎预期。