亮源新创十天连发两技术:把大模型三步范式搬进机器人

2 阅读

具身智能的“鸿沟”与大模型的旧路

过去三年,大语言模型的发展路径清晰得近乎教科书:先靠海量数据预训练出基础能力,再通过人类反馈对齐(如RLHF)把能力转化为可用性,最后借大规模真实部署产生的反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步,一步一个台阶。

图片

如今,同样的问题开始在具身智能领域浮现:这条路,能不能在物理世界原样再走一遍?

图片

提出这个问题,是因为当前具身智能正卡在一道熟悉的“鸿沟”前。模型在仿真环境中的分数越来越高,演示视频也越来越炫,但一旦放到真实世界,换一个场景、换一台机器,往往就得重新采集数据、重新训练。而在物理世界里,差一点就是失败;失败之后,大多数机器人只能停在原地等人来救。榜单上的领先,与真实世界的可用之间,始终隔着一段难以跨越的距离。

图片

最近,一家名为亮源新创的公司,用两次技术发布给出了自己的回答:9月1日开源通用导航模型 LightNav-0,9月9日又推出机器人韧性控制技术 Light REACT。前者对应“对齐”,后者对应“部署”——落子的位置,严格对着大模型那三步棋。

文章配图

这并非偶然。公司创始人姜旭曾是OpenAI的算法专家,专注RLHF研究,正是ChatGPT背后的核心对齐方法。创业后,他率先提出“规模化预训练(Scalable Pre-Training)、规模化对齐(Scalable Alignment)、规模化部署(Scalable Deployment)”的三段范式。他的信条很明确:通用比专用重要——先实现全场景的泛化,再追求全场景的精确。这与当前主流“先在单一场景做精、再谈泛化”的打法截然不同,算得上是一条“反共识”路线。

文章配图

亲历者:见过“能力如何变成可用性”的完整答案

图片

要理解亮源新创为何如此下棋,得回到RLHF在大模型历史中的关键作用。

2020年的GPT-3已证明规模化预训练的威力,但它本质上只是“补全下一个词”。看起来聪明,却不好用。真正的转折点在于对齐:InstructGPT通过人类反馈的强化学习,把“会补全”驯化成“会干活”。同一个基座模型,交互体验天差地别。随后,ChatGPT将对齐后的模型推向亿级用户,真实使用中暴露的问题源源不断回流,成为下一代模型的养料。

换句话说,能力、可用性、进化速度,分别来自三个不同的环节。这是大模型行业用五年时间换来的核心认知。

姜旭的履历恰好穿过了其中最关键的一环。在OpenAI从事RLHF研究,意味着他亲眼见证“对齐”如何把一个只会预测文本的模型,变成真正改变行业的产品。当许多团队还在讨论范式的理论框架时,他已经见过这套机制完整运转的成果。

这段经历,解释了亮源新创技术选择中那股罕见的笃定:

  • LightNav-0 的后训练严格按“中期训练—SFT—在线RL”三阶段展开,几乎是大模型后训练流程的具身翻版;
  • Light REACT 则干脆把偏好对齐做进了机器人全身控制:先通过监督学习整合起身、行走和爬行技能,再用强化学习对齐“能站着走,就别爬”的人类偏好。

十天两连发:对齐与部署,各落一子

9月1日开源的 LightNav-0,解决的是“认路”问题。它以开源视觉语言模型为基座,不添加任何导航专用模块,同一套模型权重可以零样本部署到人形、四足、轮式乃至飞行机器人上。模型无需新数据、不做微调,就能听懂自然语言指令并自主找路。

据其技术报告,该模型在10项公开仿真评测中取得领先。一个被复现者格外留意的细节是:仅用单目RGB图像(不依赖深度图或里程计),它在动态跟踪基准上的成绩反而超过了使用全景相机或多视角系统的方案。传感器配置降级、性能反超——这类反直觉的结果,往往最能说明方法本身的含金量。

设计上也有巧思。为了让模型“记住来路”又不被历史观测撑爆,团队参考人类记忆的遗忘曲线来分配注意力:越久远的画面保留得越粗略,眼前的画面则保持最高精度。数据方面,团队没有走遥操作采集的老路,而是将2000多个真实场景转化为仿真资产,在其中合成了4000多小时的训练数据。这意味着,真实世界定义了数据分布的边界,仿真则在这个边界内实现规模化合成——具身后训练由此跨过了最难的冷启动门槛。

工程细节上,基座选用 Qwen3-VL-4B-Instruct,团队没有为导航添加专用头,而是扩展了词表:

  • 引入双通道指点(dual-channel pointing)token,在图像坐标系中表达与任务、场景、本体无关的空间意图;
  • 通过残差向量量化(RVQ)动作分词器将意图转化为10步SE(2)轨迹——一个粗码本加两级残差码本,分辨率依次约为0.9米、7厘米与4厘米,全部由基座原生的自回归语言头解码;
  • 历史观测按遗忘曲线压缩:采样率随帧龄指数衰减,空间池化步长指数增长,支持256K至1M三档像素预算;
  • 后训练沿“ER中期训练—具身SFT—在线RL”三阶段推进;
  • 发布时还附带了一套面向部署的评测集:包含210个真实室内外场景、1097个episode。

一周后的 Light REACT(REsilient humAnoid ConTrol),解决的是“摔不垮”。发布前几天,一段测试视频在X上传开:一台双腿被绳索捆住的人形机器人,起身失败后自动转为爬行,脱困、剪断绳索,再自行站起走掉。全程由一个策略网络驱动,没有模式切换,也无人工介入。

技术博客将“韧性”拆解为一座四层金字塔

  1. 身体完好时,按指令正常行走;
  2. 被推倒或撞倒后,能自己爬起来;
  3. 部分关节断电或锁死时,切换步态(如跛行、单足跳)继续移动;
  4. 当双足行走已物理不可行,转入爬行,保住移动能力本身,而非固守某一种走法。

真机演示中最耐人寻味的一幕是:机器人双膝因“过热”断电后开始跛行,中途电力恢复(系统未收到任何信号),它从自身肢体的最新反应中推断出“腿又能用了”,随即自行站回直立行走。

Light REACT的技术配方分三步:

  1. 在动力失效、关节锁死、膝折叠约束三类伤损场景中,训练6个域专用教师策略(每域一个“恢复—行走”教师、一个“爬行”教师);
  2. 通过DAgger式多教师蒸馏,将知识并入单一学生策略,学生仅接收速度指令与本体感知,伤损识别被整体推迟为对交互历史的上下文推断;
  3. 最后用偏好强化学习对齐“可直立则直立”的人类偏好。

承载这一切的,是一个支持全身上下文学习(Whole-Body In-Context Learning)的Transformer单一模型:不依赖故障标签、不做模型切换、也不需要部署期的权重更新。

团队将韧性称为规模化部署的“最后一公里”:机器人先得摔不垮,部署产生的经验流才不会中断,数据飞轮才转得起来。

LightNav-0开源不到一周,已有第三方在消费级显卡上完整跑通官方模型并公开实测;海外技术博主对那段绑腿视频的评价是:“一套策略搞定行走、爬行与摔倒恢复,令人印象深刻。”在这个惯于用剪辑视频讲故事的赛道里,“可下载、可复现”正在成为一种更稀缺的说服力。

拼图:算法判断、训练工程与真机落地的互补阵型

把大模型的路线搬进机器人,远不止一个想法那么简单。这条技术链路天然横跨多个领域:既要有对范式与算法的判断,决定资源投向哪里;也要有大规模模型训练的工程能力,把判断变成模型;还要有真实机器人上的控制与落地能力,让模型在物理世界兑现价值。三块能力,缺一不可。

围绕这条链路,亮源新创搭建了一支优势互补的技术团队:

  • CEO姜旭牵引整体技术路线,推动范式创新与对齐方法的研发;
  • 联合创始人兼CTO范廷翔负责机器人整体工程与算法落地,确保模型能力能在真实平台上集成、验证与应用;
  • 团队在大脑算法、多模态模型训练、具身Agent等方向设有专门负责人,协同推进算法研发、规模化训练与真机部署。

公司成立于2024年底,目前在北京、深圳与新加坡三地设有团队。

具身智能的“部署时刻”

过去两年,具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识:下一阶段的胜负手不在实验室,而在真实世界——谁能让机器人持续运行、持续回传经验,谁才拥有属于自己的数据飞轮

特斯拉在自动驾驶上验证过这个逻辑,北美的人形机器人公司也在反复讲述同一个故事:部署规模决定数据规模,数据规模决定进化速度。这正是大模型故事中“部署”那一步的具身版本,也是所有玩家迟早要过的关。

从这个视角回看,亮源新创十天内的两次落子就有了另一层含义:导航解决“去哪儿”,韧性解决“倒了还能继续”——都是机器人离开实验室之前,必须先回答的问题。而按照“三段范式”的棋谱,预训练、对齐、部署三格,这家公司已经点亮了后两格的第一子。

从OpenAI到亮源新创,如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”,那么接下来要回答的,是如何让同一套范式在物理世界完整转起来。

据了解,团队围绕该范式的更多技术成果仍在推进中,一款面向消费场景的机器人产品也已在研发日程上,将在适当时机对外披露。

对这家刚刚完成首次连续亮相的公司而言,十天两子只是开局。这盘棋能不能在物理世界里走通,现在下结论还早。但至少,它并不是一张凭空画出的棋谱——毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。