中国模型登顶全球视频推理最严基准:VLX-VR如何突破长视频理解瓶颈?

2 阅读

近年来,人工智能在文本和图像领域的进展已广为人知,但真正让AI“理解世界”的关键,或许藏在动态的视频之中。视频不仅是像素的堆叠,更是时间、动作、因果与意图交织的复杂信息流。正因如此,视频深度推理被视为通向通用人工智能(AGI)和物理AI落地的核心能力之一。2024年9月1日,杭州联汇科技股份有限公司(简称:OmAI联汇)正式发布其最新成果——视频深度推理模型VLX-VR,一举在全球公认的“最严视频推理考卷”MINERVA上登顶榜首,准确率达78.8%,超越谷歌Gemini 3.5、OpenAI GPT-4.1等国际旗舰模型,标志着中国在这一前沿赛道实现关键突破。

MINERVA由Google DeepMind与哥伦比亚大学联合推出,被业界誉为视频推理领域的“黄金标准”。该基准包含1000余道基于真实长视频设计的复杂推理题,不仅要求模型给出正确答案,更强调推理过程的逻辑性与可解释性——即“既考答案,又考过程”。人类在此基准上的平均得分为92.5分,而此前公开模型的最高成绩仅为70.7分。VLX-VR以78.8%的准确率大幅刷新纪录,更重要的是,其推理逻辑一致性高达96.2%,意味着模型的思考路径与人类专家高度吻合,具备极强的过程可追溯性。

这一成绩的背后,是VLX-VR在长视频理解上的颠覆性表现。传统多模态模型在处理长视频时往往面临信息衰减、注意力分散和计算资源爆炸等问题,导致性能随视频时长增加而显著下降。然而,VLX-VR展现出罕见的“越长越准”特性:在5分钟以下视频中准确率为76.70%,5至15分钟区间提升至78.73%,而在15分钟以上的长视频中,准确率进一步攀升至80.92%。其跨时长准确率方差(CDAV)仅为2.97,远低于行业平均水平。作为对比,据MINERVA官方论文数据,Gemini 2.5 Pro(Thinking模式)在15分钟以上视频中的准确率仅为57.97%,GPT-4.1更是低至47.25%。VLX-VR不仅填补了长视频推理的能力空白,更重新定义了视频理解的技术边界。

技术层面,VLX-VR的成功并非偶然,而是源于OmAI联汇团队长期积累的“-R1”推理范式。早在2025年2月(注:此处应为2024年2月,原文或有笔误),该团队就在GitHub开源了视觉推理模型VLM-R1,首次将DeepSeek-R1的强化学习推理框架引入视觉领域。该模型上线48小时内即登顶GitHub全球趋势榜,引发学术界广泛关注。VLM-R1的核心创新在于将“链式思维”(Chain-of-Thought)与强化学习结合,使模型不仅能输出结果,还能生成符合人类认知逻辑的中间推理步骤。此后一年多,团队持续迭代,将研究重心从静态图像的单帧理解,逐步拓展至动态视频的时序建模与因果推理。

VLX-VR作为VLX家族的最新成员,继承并深化了这一技术路线。VLX系列定位为“端侧流式多模态模型”,强调在边缘设备上实现实时感知与决策闭环。其核心理念可概括为“看见、看清、行动”——即先感知环境,再精准识别,最终驱动物理响应。而VLX-VR在此基础上新增了“看懂”能力,即对视频中事件的先后顺序、因果关系、状态变化进行深度推理。例如,面对一段工厂流水线视频,模型不仅要识别出机械臂的动作,还需判断“零件是否因传送带故障而堆积”“操作员干预是否及时”等隐含逻辑。这种能力对于自动驾驶、工业质检、安防监控乃至家庭服务机器人至关重要。

值得注意的是,VLX-VR的推理机制并非简单堆砌参数或依赖海量标注数据,而是通过结构化记忆与动态注意力调度实现高效长程建模。据技术文档透露,模型采用分层时序编码器,将视频划分为语义连贯的“事件单元”,并在单元间建立因果图谱;同时引入轻量级推理控制器,动态决定何时回溯历史、何时聚焦当前,从而在有限计算资源下维持高精度。这种设计使其在端侧部署成为可能,也为后续与机器人本体的集成奠定基础。

从产业视角看,VLX-VR的发布恰逢中国物理AI与具身智能发展的关键窗口期。2024年8月,工信部接连释放强烈政策信号:先是公示《国家人形机器人产业标准体系建设指南(2026版)》征求意见稿,明确将“类脑与智算”列为六大核心技术板块之一;随后在国新办“十五五”规划发布会上,将具身智能正式纳入未来产业重点方向。这些举措表明,国家层面正加速推动AI从“数字世界”走向“物理世界”,而视频理解正是物理AI感知环境、理解任务、做出决策的基石能力。

OmAI联汇CEO赵天成曾指出:“物理AI正大规模走出实验室,进入真实场景。”这一判断正在被验证。无论是仓储物流中的自主搬运机器人,还是家庭场景中的陪伴型人形机器人,其核心挑战都在于如何从复杂、动态、非结构化的视觉输入中提取有效信息并作出合理反应。过去,这类系统多依赖预设规则或短时感知,难以应对开放环境中的意外事件。而VLX-VR所代表的深度视频推理能力,使得机器人能够“看懂”一段视频背后的完整故事——比如识别老人跌倒后的求助意图,或判断交通拥堵是否由事故引发——从而做出更安全、更人性化的响应。

更深远的意义在于,VLX-VR在国际权威基准上的领先,为中国AI技术提供了可量化、可比较的“标尺”。长期以来,视频理解领域的话语权由欧美科技巨头主导,评测标准、数据集和模型架构均出自其手。MINERVA虽由学术机构发起,但其影响力已迅速被产业界采纳。VLX-VR在此平台上的登顶,不仅是一次技术胜利,更是一次标准话语权的争夺。它证明中国团队不仅能参与国际竞争,还能在最前沿的“硬核”赛道设定新标杆。

当然,挑战依然存在。MINERVA虽严苛,但仍基于有限规模的真实视频;实际应用场景中的光照变化、遮挡干扰、多目标交互等问题更为复杂。此外,如何将VLX-VR的推理能力与运动控制、语言交互等模块深度融合,构建完整的具身智能体,仍是系统工程层面的巨大挑战。但可以肯定的是,随着VLX-VR开放体验平台的上线,更多开发者、研究者和企业将有机会在其基础上构建垂直应用,加速技术从实验室到产业的转化。

回望整个发展历程,从VLM-R1的开源引爆社区,到VLX-VR登顶MINERVA,OmAI联汇走出了一条“以推理为核心、以场景为导向”的差异化路径。在大模型竞赛日益同质化的今天,这种聚焦特定能力纵深突破的策略,或许比单纯追求参数规模更具可持续性。当AI不再只是“知道答案”,而是“懂得为什么”,我们离真正的智能体才更近一步。而VLX-VR,正是这条路上的一座重要里程碑。