拒绝云端幻觉:Om AI为何死磕端侧流式多模态的物理AI闭环?
逆向选择的长期主义:当行业追逐生成式AI时
在2026年的AI产业版图中,物理AI已从概念炒作步入场景验证的深水区。然而,回望2019年,当赵天成从卡耐基梅隆大学(CMU)语言技术研究所博士毕业时,他面临的选择看似清晰却充满诱惑:留在学术界成为教授,或进入大厂拥抱当时方兴未艾的大语言模型热潮。但他选择了第三条更为艰难的道路——创业,并押注了一条在当时几乎无人理解的技术路线:不做纯文本生成,而是死磕“视觉+语言”的流式多模态。

这种选择在当时的AI界堪称“反共识”。彼时,主流叙事是离线抽帧,即将视频拆解为静态图像进行批量处理,推理过程离散且滞后。赵天成及其团队则坚持“流式”理念,模拟人眼观看视频的自然过程,让视频像水流一样持续输入模型,AI在其中进行不间断的感知与决策。这一决策背后,是赵天成在雅虎多模态智能体项目中的深刻洞察:多模态赋予AI的不是简单的对话能力,而是对物理世界“活物”般的感知力。

五年间,AI赛道经历了从文本生成到文生图,再到VLA(视觉-语言-动作)和世界模型的数次洗牌。资本与同行的劝阻从未间断,但Om AI联汇的核心团队始终围绕“V”与“L”这两个核心模态持续深耕。他们认为,视觉和语言覆盖了物理世界90%的信息,是构建智能体的基石。这种对技术路线的极致专注,最终在物理AI爆发的2026年迎来了回报。
物理AI的本质:超越VLA与世界模型的争论
当前,物理AI领域呈现出百家争鸣的态势,以语言为中心的VLA路线与以像素为中心的世界模型路线争论不休。赵天成认为,这种争论往往停留在方法论层面,而忽略了物理AI的第一性原理。在他看来,无论技术路径如何演进,物理智能体必须具备四种核心能力:语义理解、几何空间认知、决策动作控制以及对未来的预测。

VLX模型系列的诞生,正是基于对这四种能力的全面覆盖。VLX中的“X”代表无限可能,象征着模型在语义、几何、感知规划及预测维度的综合潜力。赵天成指出,VLA作为概念永远不会过时,但底层的实现方法需要不断迭代。世界模型虽然热度高涨,但其核心价值建立在语义和几何理解的基础之上,是对基础能力的扩展而非替代。

更为关键的是,物理AI的落地必须考虑分布式智能的重要性。云端集中式控制存在严重的延迟和安全风险,一旦失控,可能导致机器人跌倒或动作失灵,后果不堪设想。因此,Om AI倡导的是一种分布式的智能架构,每个物理终端都具备独立的感知和决策中枢,如同人体的小脑与大脑分工协作。这种架构不仅提升了响应的实时性,更确保了系统的安全性及鲁棒性,是物理AI走向规模化应用的关键前提。
端侧原生的架构革新:VLX系列的三大闭环
面对物理世界对实时性和低延时的苛刻要求,Om AI推出了全球首个面向物理AI的端侧流式多模态模型系列VLX。VLX并非三个独立模型的简单堆叠,而是通过Flow(感知)、Seek(定位)、Go(行动)三层架构,在同一条视频流上实现了不可分割的能力协同。

这一架构设计的核心优势在于其“端侧原生”特性。传统的多模态模型往往依赖云端强大的算力进行批量推理,难以适应端侧设备的算力约束。VLX从Day 1开始便针对端侧算力进行了架构优化,实现了“持续感知+精准定位+行动决策”的完整闭环。例如,在监控场景中,VLX能够实时分析视频流,识别异常行为并进行即时报警,无需等待数据上传云端,极大地提升了安防响应的效率。

除了模型架构的创新,Om AI还构建了数据与商业的双重闭环。在数据层面,通过百万级的摄像头、无人机和机器人终端,持续回流真实业务场景数据,反哺模型迭代,形成了强大的数据飞轮。在商业层面,公司已成功跨越PMF(产品市场匹配)阶段,营收达到亿级规模。这种从仿真实验到产业落地的快速转化,证明了其技术路线不仅具备学术价值,更具有极强的商业可行性。

从成熟硬件到新兴本体:渐进式的落地策略
物理AI的市场爆发并非一蹴而就,而是需要硬件成熟度与AI能力的双向奔赴。Om AI采取了一种渐进式的市场切入策略,按照“硬件成熟度”对终端进行排序,优先落地成熟硬件,逐步向新兴本体延伸。
目前,Om AI已在AI PC、个人智慧终端及工业物联摄像头等成熟硬件上实现了规模化应用。这些设备拥有庞大的存量市场和完善的生产链,能够快速承载多模态能力,为模型提供丰富的数据反馈。随后,公司开始向无人机、机器狗等新兴本体拓展。这些设备虽然硬件尚在完善中,但已具备初步的行动能力,亟需通过引入物理AI实现从“被动执行”到“主动决策”的跨越。
这种“一脑多形”的策略,使得Om AI能够将成熟场景中的经验迁移至新兴领域。例如,将监控摄像头中积累的视觉理解能力迁移至机器狗,使其在复杂环境中具备更强的环境感知与避障能力。这种数据的复用与能力的迁移,不仅降低了研发成本,也加速了物理AI在多样化场景中的渗透。
技术定力与商业理性的平衡
在创业初期,Om AI面临着巨大的市场教育压力和技术质疑。多模态模型作为一个全新概念,用户往往难以直观理解其价值。赵天成回忆,早期需要花费大量精力向用户解释“视觉大脑”和“万物识别”等概念,以消除市场认知的鸿沟。
从实验室到产业的跨越,更是充满了挑战。学术界的突破往往关注分数的提升,而产业界则要求极致的稳定性与用户体验。Om AI团队通过细致的模型训练与工程化数据投入,攻克了最后5%的性能瓶颈,实现了实验室模型到产业级产品的转化。此外,公司还积极推动开源策略,通过开放技术框架吸引开发者社区,收集用户反馈,加速产品迭代。这种开放心态不仅提升了行业影响力,也为公司构建了更广泛的生态护城河。
赵天成认为,物理AI的竞争核心在于数据飞轮的转速。谁能让更多的终端先跑起来,谁就能获得领先优势。Om AI凭借多年的技术积淀,在数据采集与模型训练上建立了先发优势,形成了马太效应。尽管竞争日益激烈,但其坚持的“流式多模态”路线,在端侧实时性与泛化性上的独特优势,依然构成了深厚的技术壁垒。
结语:在不确定性中寻找确定的未来
物理AI的行业格局尚处于“寒武纪”式的爆发期,技术路线尚未收敛,方法论仍在不断演进。Om AI联汇的故事,是一个关于判断力与定力的样本。赵天成及其团队没有在短期的市场热点中摇摆,而是基于对物理世界本质的深刻理解,坚持走了一条艰难但正确的道路。
从CMU的对话系统到VLX模型系列,从单一的监控场景到多元化的具身智能终端,Om AI完成了从技术验证到商业闭环的完整旅程。这一过程表明,在瞬息万变的AI时代,抵达终局的关键不仅在于跑得快,更在于比市场更早看到未来,并始终保持对核心技术路线的坚守。随着硬件成熟度与AI能力的深度融合,物理AI正逐步从科幻走向现实,而Om AI的“流式”未来,或许正是这一变革的重要推动力。
