Labimus评测发布:人形机器人如何跨越精准化学实验的高门槛?
自动化实验室的下一站:从机械臂到人形灵巧手
在传统的化学研究图景中,一位有机化学家站在通风橱前,重复着看似枯燥却至关重要的基础操作:拉开天平挡风门,归零,调整药匙角度,将粉末一点点抖入称量舟,直至显示屏停在0.850克,误差控制在±0.001克以内。这一过程依赖的是人类敏锐的触觉反馈与多年积累的肌肉记忆,通常一天要重复数十次。
然而,新药、新材料的发现背后,是一场规模庞大的试错游戏。成千上万的配方需要逐一验证,如果将这些重复性劳动交给机器人,人类科学家便能从繁琐的执行中解放出来,专注于假设提出与结果解析。近年来,“AI决策+机器人执行”已成为AI for Science(人工智能驱动科学研究)的重要技术路线。从利物浦大学的移动机器化学家到各类自主实验室的兴起,自动化程度不断加深。
但现有的自主实验室多面临一个结构性难题:实验室需要适应机器人。为了配合机械臂,实验台布局需重新规划,设备需定制改造,夹爪需针对特定步骤优化。这种“量身定制”的系统虽然高效,却缺乏通用性。一旦实验流程变更,整个硬件系统便可能失效。中国科学技术大学联合北京人形机器人创新中心推出的Labimus平台,正是试图解决这一痛点。它不再依赖专用的固定机械臂,而是将目光投向更具通用潜力的人形机器人与灵巧手,旨在打造一个能无缝融入现有化学实验室环境的通用解决方案。
Labimus:构建高保真仿真考场
要让机器人胜任化学家这一角色,首先必须解决“在哪里考”的问题。Labimus并未简单地将现实实验室3D建模,而是利用Real-to-Sim技术,重建了一个具有真实物理属性的仿真环境。这一环境涵盖了分析天平、烧杯、量筒、药匙等30余种常见实验资产,但关键在于其物理引擎的精确性。
在Labimus中,分析天平的挡风门并非预设动画,而是具备真实的导轨滑动摩擦特性,机器人需像人类一样通过指尖捏住把手并控制推力才能开启。更核心的挑战在于对“粉末”的模拟。在许多仿真平台中,颗粒物质常被简化为视觉特效或刚体集合,但在Labimus中,每一粒粉末都被建模为独立的刚体,赋予质量、碰撞及重力属性。当机器人舀起粉末时,颗粒的运动轨迹、落点分布均符合物理规律;当粉末落入称量舟,每一粒的质量会被精确累计至天平读数中。这种高保真的物理模拟,确保了评测结果对真实世界具有指导意义。
基于此真实环境,团队借助大语言模型解析标准操作程序(SOP),自动拆解出包括打开/关闭挡风门、抓取放置、去皮键按压、拾取工具及舀粉称量在内的六个原子操作,并构建了完整的七步固体称量工作流。这意味着,机器人面临的不再是工程师凭经验设计的抽象测试,而是真实实验室中每天发生的具象任务。
三级递进评测:Task Success ≠ Scientific Success
传统机器人基准测试多采用二元评价标准:任务完成即成功,未完成即失败。在搬运、开抽屉等场景下,这一逻辑行之有效。但在化学实验领域,这把尺子严重失效。机器人或许能将粉末倒入称量盘,但若最终质量误差超出SOP规定的±0.001克,该次实验在科学层面即属失败。
为此,Labimus引入了全新的三级递进评测层级:
- 第一层:任务完成度。关注基本动作是否执行,如门是否打开、物体是否被抓取。
- 第二层:连续精度指标。引入量化误差,如称量误差是否满足实验要求,位置偏移是否在允许范围内。
- 第三层:长程鲁棒性表现。考察机器人在连续多步操作中的误差累积情况,识别在哪个环节出现精度崩塌。
配合标准布局、光照扰动、纹理扰动及组合扰动四种考试条件,Labimus构建了一张3×4的评测矩阵,全面检验机器人策略的精度与鲁棒性。这种设计深刻揭示了“任务完成”不等于“科学成功”的核心逻辑,为衡量机器人是否具备真正参与科学发现的能力提供了标尺。
考场实录:精度差距与鲁棒性陷阱
在Labimus的v0版本中,ACT、Diffusion Policy、π0三种代表性机器人学习方法参与了首轮“考试”。结果呈现出一条清晰的难度阶梯,也暴露了当前具身智能的共性短板。
在简单的“开门”任务中,各模型均表现尚可,ACT最高成功率达56.7%。然而,随着任务复杂度提升,成绩骤降。在需要精细控制的“关门”任务中,表现最好的π0也仅达到40.7%。最具挑战性的“去皮键”按压任务——要求指尖以特定角度和力度瞬时接触直径仅几毫米的按钮——几乎导致所有模型崩盘,ACT成功率仅为2.0%,其他两款直接归零。
这一梯度揭示了一个关键发现:精度差距被传统二元标准掩盖。以ACT在抓取放置任务为例,若仅看二元成功,成功率为5.3%;但若引入Tier 2的精度标准(位置误差≤15毫米),合格率仅降至3.3%。换言之,在近四成被判为“成功”的操作中,机器人实际上并未达到科学实验所需的精度要求。
鲁棒性测试同样发人深省。π0在开门任务中,单一扰动(光照或纹理)对其影响有限,但当两种扰动叠加时,成功率从47.3%暴跌至40.0%。这表明,真实世界中的复合环境变化对策略的影响并非线性叠加,而是存在复杂的共振效应。这对于追求在多变实验室环境中稳定运行的机器人而言,是巨大的挑战。
瓶颈透视:本体、数据与模型的传导困境
当被问及具身智能最大的瓶颈时,Labimus项目负责人夏彦教授明确指出:“本体、数据、模型三者皆有瓶颈,但当下最突出的是本体能力。”Labimus的评测数据为此提供了有力佐证:精细接触控制的失败,根源在于现有灵巧手在高自由度、敏感力觉感知及毫秒级响应延迟方面的硬件局限。
目前市面上能达到化学实验精度的灵巧手,单只售价超30万元,且大多处于样品阶段,尚未大规模量产。“我们受限于经费,无法测试市场上所有灵巧手的极限,”夏彦坦言,“但如果本体无法完成动作,收集再多数据也无济于事;没有高质量数据,模型训练更是空中楼阁。”
这种困境呈现出层层传导的特征:本体限制导致动作执行失败,动作失败导致有效数据稀缺,数据匮乏阻碍模型泛化能力提升。此外,数据采集方案的碎片化加剧了这一难题。学术界不同团队采用视觉、触觉、UMI、第一人称视角等五花八门的采集方案,硬件规格与协议不统一,导致数据难以迁移复用。相比之下,特斯拉Optimus之所以进展迅速,很大程度上得益于其复用了自动驾驶统一规格的传感器数据,极大降低了迁移成本。
范式转移:从刷分到加速科学发现
面对Labimus这一新平台,业界不禁会问:未来的评价标准究竟是什么?
当前机器人领域的竞争逻辑往往陷入“刷分”陷阱,即在固定数据集上追求成功率的最大化。然而,夏彦指出,这种逻辑在科学场景下终将失效。“最终评价一个机器人科学家的,不应仅是它完成了多少任务,而是它是否真正加速了科学发现。例如,将新物质的发现时间从100年缩短至一周,这种效率维度是现有Benchmark所缺失的。”
Labimus v0版本仅覆盖部分原子操作与单项精度任务,完整工作流评测与Sim2Real(仿真到现实)迁移仍在进行中。团队选择在此时发布,意在抢占这一交叉领域的话语权,吸引AI与化学领域的研究者共同探索。“这是一个典型的交叉学科,做AI的不懂化学,做化学的不懂AI。我们先抛出概念,让大家看到赛道的潜力与可能性,”夏彦表示,“如果只有我们一家在做,事情永远做不大。”
对于人形机器人走进化学实验室的时间表,业界存在分歧。夏彦预计,简单基础动作在未来1-2年内可实现,全面铺开需5-10年;而部分化学工作者持乐观态度,认为随着AI发展,3-5年或可初见成效。无论时间表如何,Labimus的推出标志着具身智能正从“通用操作”向“专业科学执行”迈出了关键一步。它不仅仅是一个评测平台,更是一个指向未来的承诺:通过建立更严谨的精度标准与效率维度,推动机器人真正成为加速人类科学发现的得力助手。