多模态是LLM外挂还是智能灵魂?五位首席科学家深度拆解AI破局关键

0 阅读

跨越Scaling Law极限:多模态的本体论之争

当基础大模型的缩放定律(Scaling Law)逐渐逼近物理极限,算力边际效益递减的焦虑已成为行业共识。在7月18日举办的WAIC 2026“基座大模型架构创新与生态合作论坛”上,一场关于多模态本质的深度辩论揭开了行业转型的核心矛盾。由商汤科技首席科学家林达华主持,联合复旦大学邱锡鹏教授、达摩院首席科学家赵德丽、阶跃星辰首席科学家张祥雨以及新加坡南洋理工大学刘子纬教授,这场对话不仅是对当前技术路线的审视,更是对未来智能形态的预判。

科技论坛现场照片,展示了舞台演讲嘉宾及大屏幕上的多模态AI技

核心议题直指要害:在多模态能力成为主流旗舰模型标配的当下,它仅仅是大语言模型(LLM)在感知维度上的能力延伸,即所谓的“外挂”;还是构建下一代通用人工智能(AGI)及物理世界理解能力的“灵魂”?这一问题的答案,决定了未来五年AI产业资源的配置方向与技术演进的底层逻辑。

科技峰会现场图,大屏幕上显示关于多模态AI核心瓶颈的讨论议题

范式重构:从语言投影到物理世界建模

科技行业论坛或圆桌会议的现场照片,展示了多位嘉宾在台上进行对

关于多模态的定位,学术界与工业界存在显著分歧。邱锡鹏教授坚持“语言中心论”的演进视角,认为智能的基石依然是语言,多模态的核心挑战在于如何实现对齐而非取代。他指出,当前模型缺乏的是对复杂现实情境(Context)的理解力,未来的突破点在于构建能够支撑模型理解真实世界环境的框架体系。

相比之下,赵德丽首席科学家则从第一性原理出发,提出“多模态是下一代智能范式”的观点。他构建了通向智能的四条路径:大语言模型、开放空间机器人、数字生命模拟及神经信号交互。这四条路径的共同特征在于,它们都源于多模态信号,无一依赖单一模态。赵德丽强调,物理世界的本质是四维因果关系的建模,涵盖物理空间、属性、因果关系及动作运动,而大语言模型仅是一维的知识压缩。无论是语言还是视频生成,本质上都是对人类行为与知识的压缩,唯有通过环境与交互的多模态反馈,智能才能像猎豹捕猎那样,通过模仿与反馈习得高超技能。

刘子纬教授借用柏拉图“洞穴比喻”进行了哲学层面的阐释。他将语言比作真实世界的低维投影,如同洞穴中的影子,虽然能总结规律,但终究脱离真实。语言数据如同有限的化石燃料,而多模态数据则是开启智能新纪元的新型能源。特别是在制造业等脱离不了物理交互的高价值场景中,多模态是涌现下一代智能的必要条件。这种从“脱虚向实”的视角,揭示了AI应用场景从数字空间向物理空间不可逆迁移的趋势。

核心瓶颈:数据稀缺与架构范式的错位

尽管方向明确,但通往物理世界智能的道路并非坦途。在数据、架构与训练范式三个维度上,当前主流方法均显露出明显的局限性。

刘子纬教授冷静地指出,数据、架构与范式均不足以独立支撑下一阶段突破。在数据层面,语言模型得益于互联网二十年的语料积累与GPU算力的巧合齐备,形成了“无心插柳”的数据红利。然而,多模态数据尤其是带有长程时空关联、行为过程与反馈的物理世界数据,获取与标注难度极大。家务、工作等长程任务难以被记录,这不仅是技术难题,更是组织与社会层面的挑战。

在架构层面,刘子纬认为当前系统仍以语言模型为核心,多模态仅通过桥接方式接入。如何实现输入侧与输出侧的原生多模态支持,以及在网络哪一层进行有效表征,仍是未解之谜。这种“非原生”架构限制了模型对复杂物理规律的深度吸收。

张祥雨首席科学家则聚焦于“学习范式”与“记忆机制”。他认为,核心矛盾在于智能体缺乏自主在线学习能力。现有模型依赖静态、清洗过的高质量数据,而在面对稀疏、高维的视觉信号时,传统的模仿学习范式失效。他犀利地指出,Transformer的上下文窗口(Context)本质上是一种“工作记忆”,虽无损但有效长度有限,无法像人类海马体那样对瞬时感知、短期工作及长期语义记忆进行分层管理与压缩。当视觉信号涌入,若无法有效压缩,模型将陷入“上下文退化”的泥潭。仅靠外部记忆增强,无法让智能体产生内生演化,如同记忆力超群却缺乏思考能力的学生,难以实现长远进步。

赵德丽从产业落地角度补充道,算法收敛的表象掩盖了技术深化的需求。以具身智能为例,获取十万小时的机器人操作数据已属顶尖,但这远不足以支撑GPT-3.5级别的训练规模。然而,中国在工业、服务业及家电场景的多样性优势,为获取海量物理世界数据提供了天然土壤。他强调,将强化学习(如PPO、GRPO)引入基础模型,以及DeepSeek等模型在稀疏注意力、滑动窗口及Ingram算法上的架构创新,正是突破瓶颈的关键所在。

未来五年:高估Agent自主,低估社会重构

在预测未来五年的AI图景时,与会科学家展现出不同的洞察力。邱锡鹏教授警惕“过度预测”,认为“AI for AI”将是下一轮范式变革。既然Coding Model与Agentic Model已获突破,不如将其推向极致,由AI自主设计未来的多模态架构与范式。他强调渐进式演化的力量,从Seq2Seq到Transformer的成功,往往源于不可预见的突变节点。

赵德丽则给出了更为具体的产业预判:被高估的是Agent在企业级场景中的完全自主化能力,被低估的则是AI对社会基础设施的深度重构。他举例指出,当智能体开始介入支付体系,整个围绕人类构建的金融与社会运作逻辑将被颠覆。智能体之间的交互、支付与协作,将催生全新的社会协作形态。

林达华总结认为,2023年初人们焦虑于AI取代工作,如今发现AI更多是改变工作方式;而被低估的是强化学习与测试时扩展(Test-time Scaling)在2025-2026年的复兴速度。这种反差提醒业界,技术演进的复杂性远超线性预期。

结语:多模态作为新基础设施的必然性

综合五位科学家的观点,多模态已从辅助性的感知工具,转变为构建物理世界模型的核心基础设施。语言模型在知识压缩与逻辑推理上优势明显,但无法独立完成对三维物理空间的因果建模与动态交互。未来的突破点在于:一是构建原生多模态架构,解决高维信号的压缩与表征问题;二是革新记忆机制,实现分层记忆与在线自主进化;三是利用中国丰富的物理场景数据优势,推动具身智能与行业大模型的深度融合。

这场关于“外挂”与“灵魂”的辩论,最终指向了一个共识:智能的进化不再局限于数字文本的迭代,而是走向与现实世界深度耦合的多模态交互。AI对社会运作方式的深层渗透,将在这一进程中悄然发生,其深远影响远超今日之想象。多模态,正成为定义下一代智能竞争力的关键战场。