商汤U1 Pro交付率70%:多模态如何击穿AI设计商用深水区?
当大语言模型(LLM)在文本处理上达到近乎完美的程度时,行业目光开始不可避免地向物理世界转移。在2026年世界人工智能大会(WAIC)期间,商汤科技首席科学家林达华用一盆盆景提出了一个极具哲学意味的问题:能否用语言精确描述每一片叶子的位置?答案显然是否定的。这一“盆景之问”,精准击中了当前纯文本大模型面对真实物理世界时的隐形的边界。
人类认知世界的方式,本质上是语言与视觉的深度融合。从高级审美判断到复杂空间布局,再到自动驾驶中的实时交互,任何需要理解物理现实的场景,都依赖于真正的“视觉”能力。因此,多模态不再仅仅是锦上添花的功能,而是通往通用人工智能(AGI)的关键路径。商汤科技选择了一条看似艰难但更为本质的道路——构建原生统一的多模态架构,试图从底层打破视觉与语言的壁垒。
为什么多模态是Coding之后的下一个战场
尽管AI Coding(代码生成)是目前商业化最成熟、内卷最激烈的赛道,但林达华认为,纯文本语言的天花板已经清晰可见。无论是前端页面的视觉质感,还是复杂交互的空间美学,仅靠代码逻辑难以完美呈现。Anthropic等巨头在Opus 4.8版本中强化多模态元素,已释放出明确信号:当后端逻辑代码能力趋同,前端体验与视觉交互将成为新的竞争高地。
业界曾有一种观点认为,未来的AI智能体(Agent)将主要通过纯文本命令行(CLI)交互,视觉的价值被低估。然而,林达华指出,CLI面向机器,而视觉才是面向人类体验的核心载体。无论是办公汇报、海报设计,还是游戏开发,高频的大众场景离不开视觉。
要打造能在物理世界中思考和行动的“全能智能”,必须让视觉与语言在底层大脑中融为一体。商汤自研的NEO-unify原生统一架构,正是基于这一理念诞生。语音与文本属于同构模态,易于映射;但视觉与语言是完全异构的,像素无法简单对应文字词元。攻克异构模态融合,一直是多模态领域的核心难点,也是商汤技术突破的关键所在。
打破“拼接式”桎梏:原生统一架构的技术突围
长期以来,多模态大模型主流技术路线采用的是“拼接式架构”。即在成熟的语言大模型外挂独立的视觉编码器(VE),先将图像“翻译”成文本,再交由语言模型处理。这种方式工程门槛低、训练快,但本质是一种损失精度的“翻译”过程,导致视觉与语言融合效率低下,模型并非真正“看见”。
商汤团队坚持长期主义,致力于消除视觉编码器,建立深层融合的原生多模态架构。2025年中,团队联合南洋理工大学S-Lab验证了小规模数据下的原生融合设想。随后发布的NEO-unify架构,彻底移除了传统的视觉编码器和变分自编码器,让模型直接从像素和文字中学习。
支撑这一架构运转的是一套自研的Mixture-of-Transformers(MoT)技术。在该架构中,语言和视觉信息在模型的每一层计算中完成深度交融,其意义堪比Transformer之于大语言模型。这种架构重构带来了惊人的效率提升:NEO-unify仅需3.9亿图像文本示例(仅为业界同等性能模型约1/10的数据量),就涌现出了顶尖的视觉感知和推理能力。
开源版本SenseNova U1基于此架构,拥有真正的“图文交错思维链”,能在同一上下文中写字边插图,确保图文逻辑与风格的高度一致。而在4月推出的可交付级旗舰模型SenseNova U1 Pro,则标志着商汤在多模态商用化道路上迈出了决定性一步。
从“画图”到“设计”:U1 Pro的专业化淬炼
市面上能画出精美图片的AI不少,但在真实的商业设计场景中,它们往往成为“花架子”。设计不仅依赖审美概率,更依赖精准的逻辑与控制。U1 Pro被定位为一款具备高度审美和设计能力的产品,其背后是一场漫长且严苛的专业化数据训练。
林达华指出,让AI具备专业设计能力,需用过亿道“魔鬼级”设计题喂养。商汤构建了一个规模逼近数十亿的超大型“多模态题库”,其中单张设计图对应的文字描述往往长达上千字。训练过程分为三个阶段:预训练阶段吞吐数十亿级图文数据,打下认知地基;持续预训练阶段以高比例“合成数据”拉升专业设计能力;后训练阶段精选千万级黄金数据,精雕细琢至成品级交付质感。
支撑这套庞大合成数据体系的,是商汤内部由超级Agent驱动的自动化数据合成管线。这种对数据的极端严苛要求,确保了模型不仅能“画得像”,更能“理得清”。
70%交付率:击穿商业落地的最后一道关卡
在学术界,生成一张图片哪怕有100个字错1个,也能得高分;但在真实商业世界,一个错字就可能导致设计稿作废。U1 Pro的核心竞争力在于其高达70%的商用交付率。根据林达华披露,这一指标意味着文字错误率控制在千分级,图形元素、空间布局、色彩搭配等细节错误同步控制在千分级。
放眼全球,多模态模型突破60%商业可交付基准线的仅有两家:商汤U1 Pro和OpenAI的GPT-Image-2。这一数据背后,是商汤独创的“视觉拆解思维链”学习模式。模型在训练过程中,会自动拆解高质量海报的视觉组件,逆向推理设计师的版式布局逻辑与色彩搭配思路,从而内化“思考式”设计能力。
在实际生成中,U1 Pro采用多轮智能体生成闭环:先拆解信息规划版式,再全图生成,最后进行全局自检(识别文字错误、布局瑕疵),不断迭代直至符合标准。此外,商汤组建了由200名美院学生和专业设计师组成的“人类审美团”,通过高强度的“找茬”与打分,打磨出审美的“最后一公里”。
从二维设计到三维世界:多模态的终极图景
U1 Pro不仅局限于二维平面,它已展现出初步的空间推演能力。在商汤的“1+X”战略下,多模态底座是基础,世界模型、具身智能等均是其自然分支。商汤近期发布的SenseNova-Vision视觉大模型,让视觉成为通用基础模型的原生能力,在目标检测、3D重建等任务上超越了专用模型。
展望未来,下一代U2模型将真正走向三维,融入视频理解与生成,实现感知、理解、生成、行动的一体化。更远的终极形态,则是扩展至几十种传感器信号,构建完整的“世界模型”。林达华认为,未来的解法可能不是穷尽所有数据组合,而是对世界属性进行解耦,拆分出不同属性的专用子模型进行协同推理。
在这场通往物理世界AGI的科学马拉松中,商汤通过原生统一多模态架构,正在重新定义AI创作的生产力标准。当AI不再仅仅是内容的生成者,而是成为具备逻辑思维与审美判断的设计伙伴,多模态技术才真正迎来了其最具价值的商用深水区。