紫东太初开源ZDTaichu5.0-9B:专注物理世界的空间推理多模态模型

1 阅读

一个专为“看懂物理世界”而生的模型

最近,紫东太初团队开源了 ZDTaichu5.0-9B,一款90亿参数的通用多模态大模型。和市面上多数追求“全能”的模型不同,它把重心放在了一个具体但关键的方向:理解并操作物理世界中的物体和空间关系。

Loomy

简单说,这个模型不只是能看图说话,还能准确判断“杯子在桌子的右前方”、“第三个货架第二层的红色盒子可以抓取”,甚至规划机器人如何一步步完成“从A处取试管,移到B处滴加液体,再放回C架”的完整流程。这种能力对工业自动化、实验室机器人、智能仓储等场景至关重要。

ZDTaichu5.0-9B 的成绩很硬核:在九大国际公认的空间理解基准测试中,它拿下了8项同参数(9B级别)的全球第一。其中,MindCube-tiny 这个综合空间推理测试,它得了78.27分,比主要竞品高出20多分,甚至在某些项目上超过了闭源的 Gemini 3 Pro。更难得的是,它在强化空间能力的同时,没有牺牲图文理解、OCR识别、数学解题和代码生成这些通用能力,依然稳居第一梯队。

自适应循环推理:只在“拿不准”时多算几步

ZDTaichu5.0-9B 最核心的技术创新是“自适应循环推理”。传统模型在生成每个词(Token)时,通常只做一次前向计算就输出结果。但面对复杂的空间关系或模糊图像,一次计算可能不够准。

这个模型引入了一个叫“熵门控”的机制。简单理解,就是模型在生成每个词时,会先评估自己对这个预测有多“确定”。如果概率分布很集中(比如99%确定是“左”),那就直接输出,不浪费算力。但如果概率分布很分散(比如“左”40%、“右”35%、“前”25%),说明模型自己也“拿不准”,这时就会触发循环计算。

在循环中,模型会针对这个不确定的位置,反复执行部分网络层的计算,像人一样“再仔细想想”。每轮修正都会参考最初的表征,防止思路跑偏,并通过 KL 散度和隐状态残差来判断是否已经收敛。最终,它会从多轮结果中选出最稳妥的那个输出。这套机制让它在保持平均推理成本可控的前提下,显著提升了复杂任务的准确性。

训练数据:从仿真到真机,层层递进

模型的能力离不开扎实的训练。ZDTaichu5.0-9B 的训练采用了渐进式数据课程。

第一阶段是大规模预训练,数据来源包括海量图文、网页内容、多视角视频以及三维仿真环境数据。所有数据都经过严格去重和质量过滤,确保“地基”牢固。

第二阶段是监督微调(SFT),这才是体现其专业性的关键。团队投喂了大量真实的业务问答、空间推理案例,以及机器人 Agent 在仿真和真机环境中执行任务时留下的工具调用轨迹。更重要的是,他们对这些样本做了严格校验,确保图像中的物体、它们之间的空间关系以及操作约束(比如“不能从上方抓取易碎品”)在逻辑上是一致的。这避免了模型学到错误的因果关联。

最后阶段,模型通过长推理样本进行退火训练,并结合 GRPO 强化学习。奖励信号不是模糊的人类偏好,而是可自动校验的硬指标:答案是否正确、预测的坐标是否命中目标、输出格式是否合规等。这让模型学会了如何一步步拆解并完成长程任务。

真实场景验证:不止于跑分

很多模型在排行榜上风光无限,一到真实环境就“水土不服”。ZDTaichu5.0-9B 的一个亮点是,它已经在科研和工业的真机任务中跑通了。

在科研实验自动化方面,它充当“高层编排大脑”,能理解并执行复杂的实验流程。比如,给它一个指令:“将1号试管中的溶液,用滴管转移0.5ml到3号试管中。”模型不仅能看懂实验台的布局,记住各个试管的身份和位置,还能规划出完整的操作步骤,并在每一步后通过摄像头反馈确认状态,形成“感知—认知—行动—反馈”的闭环。

在工业制造场景,它被用于备料配送、机台上下料和工位整理。面对密集货架、物体相互遮挡、或者前置条件未满足(比如“必须先打开盖子才能取料”)等棘手问题,模型都能给出可靠的解决方案。它能精准定位目标物体的可抓取点,并在操作后回头检查放置是否正确,大大提升了自动化系统的鲁棒性。

开源与部署:开发者友好

对于开发者来说,ZDTaichu5.0-9B 的另一个巨大优势是完全开源。模型的权重、详细的数据生产方法和训练方案都已公开,分别托管在 Hugging Face 和 GitHub 上。

90亿参数的体量,意味着它可以在单张消费级或专业级 GPU 上进行本地部署,显存需求相对友好。用户可以直接下载权重,通过图像加文本指令的方式与模型交互,获取方位判断、目标坐标等空间推理结果。

更重要的是,开发者可以用自己领域的数据,基于官方提供的方案进行二次微调。无论是定制化工厂的特定物料识别,还是特殊实验室的仪器操作,都可以让模型快速适配自己的现场环境,真正实现“开箱即用,按需定制”。

与竞品的差异:专注带来优势

对比阿里通义的 Qwen3.5-9B 等通用多模态模型,ZDTaichu5.0-9B 的定位非常清晰:不做面面俱到的“六边形战士”,而是成为物理世界空间理解的“尖子生”。

在具体的测试案例中,当被问及“右前方的物体是什么”时,ZDTaichu5.0-9B 能正确理解参照系并给出答案,而竞品则出现了参照系错乱的问题。在需要绑定属性并排序的任务中(如“找出第二个红色盒子”),它的坐标预测能精准命中真值,而竞品则指错了位置。在可供性推理(判断哪里可以放置物体)上,它也能准确找到空闲且合规的区域。

这种差异源于其技术栈和训练数据的针对性。通用模型的优势在于生态和广泛适用性,而 ZDTaichu5.0-9B 则在特定赛道上实现了越级对标,用更低的部署成本,提供了接近甚至超越更大闭源模型的空间智能。

总结

ZDTaichu5.0-9B 的出现,为需要深度理解物理世界的AI应用提供了一个强大且务实的工具。它证明了在大模型领域,除了参数竞赛,深耕垂直场景、解决具体问题同样能带来突破。对于正在探索工业自动化、科研机器人或任何涉及空间操作的开发者而言,这个开源项目值得关注和尝试。