WAIC深度对话:多模态是LLM外挂还是AI灵魂?五大首席科学家揭秘未来智能

0 阅读

人工智能的发展正站在一个关键的十字路口。当Scaling Law(缩放定律)在物理算力与数据增长的夹击下逐渐逼近极限,行业内部的焦虑感日益弥漫:大语言模型(LLM)究竟是通往通用人工智能(AGI)的终点,还是必须被跨越的阶梯?多模态能力,这一当前顶尖模型的标配功能,究竟只是语言模型在感知维度的自然延伸,还是下一代智能形态的真正灵魂?

2026年7月,在WAIC 2026最受关注的“基座大模型架构创新与生态合作论坛”上,这场争论达到了白热化。由商汤科技首席科学家林达华主持,汇聚了复旦大学邱锡鹏教授、达摩院首席科学家赵德丽、阶跃星辰首席科学家张祥雨以及新加坡南洋理工大学刘子纬教授的五位顶尖学者,展开了一场关于多模态AI本质、瓶颈与未来的深度交锋。这不仅仅是一次学术探讨,更是对中国AI行业在迈向“深水区”时的一次集体审视。

科技论坛活动现场图,展示了舞台演讲、大屏幕上的多模态AI技术

走出洞穴:从“语言投影”到“物理实境”

科技峰会现场图,大屏幕显示关于多模态AI核心瓶颈的讨论议题,

论坛伊始,林达华抛出了一个直击核心认识论的问题:未来AI应当以语言为中心,还是以世界为中心?

长期以来,基于Next Token Prediction(下一个词元预测)的大模型在数字文本领域取得了巨大成功,这使得部分观点认为多模态仅是语言模型的“外挂”。邱锡鹏教授对此持谨慎态度,他承认智能仍需依赖语言的抽象能力,多模态的重点在于与语言的对齐。但他尖锐地指出,当前模型缺乏对“Context”(情境)的真实理解。多模态不仅仅是像素和声波的堆砌,更是现实复杂情境的数字化映射。未来的瓶颈不在于数据量的增加,而在于如何构建一套Harness(支撑系统),将物理世界的时空、因果、逻辑转化为模型可理解的深层信息。

相比之下,赵德丽的观点更为激进且富有哲学高度。他引用柏拉图的“洞穴比喻”,认为语言只是真实世界的一维投影,而智能的本质是四维因果关系的建模。他提出了通向智能的四条路径:大语言模型、开放空间机器人、数字生命模拟以及神经信号交互。这四条路径的共同点在于它们都是多模态的,且无一例外地源自智能生成的源头信号。赵德丽强调,猎豹捕猎、蚂蚁寻路等高级技能并非通过语言习得,而是通过与环境的交互、模仿与反馈。因此,无论是知识压缩还是行为记录,多模态模型才是构建“世界模型”、理解物理规律的唯一范式。

刘子纬教授则从数据演化的角度补充了这一论断。他将语言数据比作“化石燃料”,虽然丰富但终究有限;而多模态数据则是即将到来的“新能源”。在制造业等高危、高价值领域,多模态不仅是工具,更是涌现下一代智能的必需品。

结构性困境:记忆、架构与范式的三重枷锁

尽管方向明确,但通往物理世界智能的道路布满荆棘。林达华将话题拉回现实:当前的数据、架构和训练范式,是否足以支撑这一跃迁?

刘子纬冷静地指出,数据、架构、范式三者均存在局限。在数据层面,互联网积累的语言语料是“无心插柳”的结果,而多模态数据(尤其是带有长程因果、时空关联的视觉与物理交互数据)缺乏有效的记录、标注与保存范式。这不仅是技术难题,更是社会协作问题。在架构层面,主流模型仍以语言为核心,多模态通过桥接方式引入,缺乏原生多模态架构在输入表征、稀疏编码及长上下文处理上的深度优化。

张祥雨则进一步剖析了“记忆机制”这一关键短板。他提出,当前的Transformer架构本质上是一种“工作记忆”,其上下文窗口虽然长,但有效长度有限,且存在严重的上下文退化问题。更致命的是,多模态信息的高维稀疏性使得压缩变得极难。如果将百万Token的图像强行塞入上下文,模型将面临巨大的算力与精度损耗。张祥雨形象地比喻道:仅靠外部记忆(Context)无法实现智能体的自我演化,就像学生虽然笔记做得再好,若海马体(长期记忆机制)无法重组知识,便无法取得长远进步。

针对这一问题,张祥雨提出了“在线学习”与“分层记忆建模”的突破方向。人类的记忆分为瞬时感知、短期工作、长期情境与语义记忆等多个层级。当前的AI模型缺乏这种分层机制,无法像人类一样主动选择、压缩和清除信息。此外,虽然强化学习(RL)在推理任务中表现优异,但其数据效率依赖于On Policy的自我生成与蒸馏。未来,世界模型的构建与高效的在线学习算法,将成为解决监督信号稀疏问题的关键。

赵德丽从产业视角补充了数据与架构的耦合关系。他警告行业不要陷入“只做应用、忽略底层”的误区。AI从数字空间走向物理世界,首先面临的是物理世界数据的极度稀缺。目前机器人领域的数据积累尚不足以支撑GPT-3.5水平的训练。然而,中国拥有全球最丰富的工业、服务业及家电场景,这种多样性构成了具身智能的天然优势。在架构上,如DeepSeek的Ingram算法,通过知识注入与端到端训练,展示了软硬件协同与架构创新的巨大潜力。

科技论坛或行业会议的现场讨论照片,展示了多位嘉宾在台上进行对

五年之辩:高估自主,低估重构

站在2026年的节点展望五年后的未来,科学家们对“高估”与“低估”给出了截然不同的洞察。

林达华回顾指出,2023年人们高估了AI对工作岗位的即时取代效应,却低估了AI改变工作范式的速度,特别是强化学习在2025-2026年的回归以及“测试时扩展”成为独立竞赛维度。

邱锡鹏教授则展现了学术家的审慎与开放。他预言“AI for AI”可能成为下一阶段的主旋律。既然Coding Model和Agentic Model已出现突破,不妨让AI去设计更高效的下一代多模态模型。他强调渐进式演化的力量,真正的范式变革往往源于看似微小的优化累积,最终在某个突变点爆发。

赵德丽的判断则更具社会穿透力。他认为,行业高估了Agent在企业级场景中的“自主化”能力——目前的智能体仍难以脱离预设框架实现真正的商业自主。相反,AI对社会底层运作机制的重构将被严重低估。他以支付体系为例,指出随着智能体间交互(Agent-to-Agent)的增加,现有的围绕人类构建的移动支付与信用体系将面临彻底重构。这不仅是技术的迭代,更是社会契约与经济运行逻辑的革新。

结语:原生多模态与物理智能的必由之路

通过这场高密度的思想碰撞,我们可以清晰地看到一条演进主线:多模态不再是LLM的附属品或“外挂”,而是通往物理世界智能的原生基础。

当前的AI产业正面临从“数字空间模拟”向“物理世界交互”的不可逆迁移。这一迁移要求我们在算法架构上抛弃纯语言中心的思维定势,转向原生多模态设计;在训练范式上从静态的Next Token Prediction转向动态的在线学习与强化探索;在记忆机制上引入分层、可压缩、可遗忘的类脑结构。

对于中国AI产业而言,这既是挑战也是机遇。在算力与基础数据受限的背景下,利用中国独有的丰富工业与场景数据,深耕具身智能与垂直领域的世界模型构建,有望在下一轮全球AI竞争中确立差异化优势。多模态作为“灵魂”还是“外挂”的争论终将被时间消解,取而代之的是对物理世界深刻理解与高效交互能力的争夺。这不仅是技术的胜利,更是人类智能向机器智能投射的一场深刻革命。