合肥再押中AI独角兽:多模态赛道3月融21亿,底层架构如何破局?
资本风向标:从LLM到多模态的范式转移
2026年7月,人工智能领域的资本流动呈现出一种极具象征意义的转折。智象未来(HiDream.ai)宣布完成15亿元人民币的C轮融资,这并非孤立事件,而是其近三个月内完成的第三轮融资。三轮密集注资累计超过21亿元,使得这家专注于多模态大模型的公司估值正式突破10亿美元大关,跻身全球AI独角兽俱乐部。
这一里程碑式的融资背后,折射出的是整个AI行业估值逻辑的深刻重构。过去两年,资本市场的焦点几乎完全集中在大语言模型(LLM)上,参数规模的竞赛、基准测试分数的提升,构成了主要的估值锚点。然而,随着开源模型的密集发布和通用能力的边际效应递减,单纯依靠文本交互和代码生成的LLM,其技术壁垒和估值溢价正在面临严峻挑战。市场开始意识到,LLM本质上是基于概率的符号系统,它擅长处理人类文明已编码的知识,却难以真正理解物理世界的空间、时间与因果关系。
相比之下,多模态赛道,尤其是视觉与视频生成领域,正迎来爆发式增长。2026年国内AI视觉领域的融资总额已逼近300亿元,字节系的Seedance、可灵等大厂产品数据飙升,独立创业公司也接连获得大额融资。这种资本的热捧并非盲目跟风,而是基于对AI未来形态的共识:AI正在从“文本智能”向“物理智能”跃迁。多模态大模型,特别是具备世界模型能力的架构,被视为下一代AI基础设施的核心。智象未来的崛起,正是踩中了这一时代拐点,其技术路线与资本预期的完美契合,使其成为本轮周期中的焦点。
多元化资本集结:不同视角下的价值共识
智象未来本轮融资的投资人名单,堪称一级市场的一次“全明星阵容”。领投方包括社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本,跟投方则涵盖了厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本等十余家机构。更值得注意的是,老股东合肥产投、东方富海、金浦投资等持续加注。
这种国资、产业资本、市场化VC在同一轮次密集扎堆的现象,在当前的AI投资环境中极为罕见。通常,随着融资轮次推进,股东结构会趋于收敛,而智象未来的多元化结构揭示了不同属性资金对其价值的差异化认可。
对于社保基金和工银资本等国家级或大型金融机构而言,投资逻辑侧重于“路线”的战略安全性。全模态世界模型是否最终成为主流架构尚无定论,但其作为下一代AI基础设施的潜力巨大。社保基金首次投资多模态大模型方向,工银资本首次出手此类企业,表明这些长期资本正在通过布局前沿技术,锁定未来十年的科技红利。
影视产业资本的入局则更具产业协同意味。上影股份和华策影视的加入,不仅是财务投资,更是业务层面的深度绑定。双方已在新型内容创制、院线场景升级、AI跨屏整合营销等领域展开合作。对于影视巨头而言,AI不仅是工具,更是重塑内容生产流程、降低制作成本、创新叙事方式的关键变量。这种“资本+场景”的双重绑定,为智象未来的技术落地提供了最直接的试验田。
地方国资如合肥产投的持续加注,则体现了城市对高科技产业的战略渴求。合肥过去在长鑫科技、京东方等项目上的成功,证明了其在行业黎明期下重注的能力。智象未来被置于相似的战略位置,成为合肥打造AI产业集群的标志性项目。
而敦鸿资本、弘颐资管等顶级市场化VC的集体入局,则是基于对技术硬核程度和商业落地能力的专业判断。多家机构首次布局视觉大模型赛道,侧面印证了智象未来在技术路线、团队积淀及商业化能力上的稀缺性。不同背景的出资人,从各自坐标出发,拼凑出了对智象未来价值的完整图景。
架构革命:UiT原生全模态如何打破“缝合怪”困境
要理解智象未来的核心竞争力,必须深入其底层技术架构。当前AI行业的主流叙事曾长期被“规模法则”主导,即认为参数越大、数据越多,模型越聪明。然而,这种范式存在先天缺陷:LLM是“书斋里的思想家”,其智能局限于符号系统内部。
智象未来选择了一条更为激进且底层的路径:从视觉像素出发,构建原生全模态架构。这一选择基于一个核心判断:图像是信息密度极高的模态,一张图片定格了物理世界的完整状态,包含空间、光影、材质等丰富信息。
传统的多模态模型往往被称为“缝合怪”。它们通常在语言模型之外挂载图片理解模块和生成模块,各模态分别编码,最后在外层拼接。这种架构导致信息在不同模块间传递时产生损耗,且以文本为轴心,其他模态仅为插件。
智象未来的UiT架构试图颠覆这一范式。它摒弃了独立的文本编码器和VAE模态传导介质,将图像像素、文本Token、视频体素、音频、动作及空间关系等原始信号,统一进行Tokenization。所有信号由同一套Transformer网络完成理解、生成和推理。这意味着,文生图、长文本渲染、指令编辑、主体驱动、故事板生成等任务,均由同一个模型端到端处理。
这种原生全模态架构的优势在于消除了模态间的转换损耗,使模型能够更自然地理解多模态数据之间的内在联系。2026年5月,智象旗下HiDream-O1-Image(8B参数开源版本)以“Peanut”匿名身份登上全球知名AI模型评测平台Artificial Analysis的文生图榜单,成为前20名中参数最小的模型,并位列开源第一。随后,商用版HiDream-O1-Image-1.5再次登顶中国图像模型榜首,位列全球前三,在光影、复杂构图、指令跟随及中英文渲染上表现卓越。
这些成绩并非偶然,而是原生全模态架构在第三方评测体系中的直接验证。当行业还在争论世界模型是否可行时,智象未来已通过技术落地,证明了其路线的可行性与优越性。
商业闭环:从技术验证到产业落地的三级跳
技术优势若不能转化为商业价值,便只是实验室里的概念。智象未来早已搭建起“1+1+3”的商业化体系,实现了从底层技术到场景应用的三级跳。
第一层是HiDream全模态大模型底座,承载所有底层技术创新与算力支撑;第二层是HiHarness企业能力中台,对外输出标准化、可复用的模型能力,适配企业定制化需求;第三层聚焦商业营销、影视创作、社媒创作三大垂直场景,打造专属AI智能体产品。
其中,2026年WAIC上发布的vivago R1多模态创作智能体,成为技术落地的核心标杆。针对行业长期存在的视频生成时长受限、画面跳变、人设错乱等痛点,vivago R1实现了突破性革新。它搭载长链路叙事规划能力,摒弃了传统的“抽卡式”随机生成,先完成整体脚本与镜头规划,再分段落地生成并智能纠错。单段任务失败可独立重试,不影响整体进度。
这一架构革新将AI内容商用有效成功率提升至85%,跨过了企业规模化商用的核心门槛。vivago R1不仅是一个生成工具,更是一个能理解风格、执行意图、保持叙事连贯的创作伙伴。
一个典型的测试案例展示了其独特能力:用户要求生成一部“叶什尔查姆风格”的荒诞科幻短片。叶什尔查姆是土耳其上世纪六七十年代的商业电影黄金时代,以低成本、粗粝道具和夸张表演著称,如《土耳其星战》中硬纸板怪兽和手绘背景。这种风格要求模型理解“不完美”,在“假”与“可笑”之间精准踩中阈值。
大多数模型倾向于输出“好看”但风格不符的画面,而vivago R1精准复现了那种荒谬感,同时保持了镜头间的叙事连贯。这一案例证明,真正的创作工具必须能理解风格并执行意图,而非仅仅生成漂亮的单帧。
目前,vivago海外版已覆盖全球100多个国家和地区,服务超5000万用户。今年5月,其灰度版登顶Product Hunt日榜第一,被硅谷知名Product Hunter Chris Messina评价为“Think Claude Code, but for video”。这表明,智象未来在商业化落地能力上已稳居行业第一梯队。
结语:物理智能时代的竞争起跑线
智象未来的崛起,不仅是单一公司的成功,更是AI行业从文本智能向物理智能范式跃迁的缩影。随着大语言模型估值红利见顶,多模态视觉赛道成为新的增长极。智象未来通过UiT原生全模态架构,打破了传统“缝合怪”模式的局限,实现了技术上的差异化突围。
多元化资本的集体押注,反映了市场对世界模型战略价值的广泛共识。从社保基金的长线布局到影视产业的应用协同,再到地方国资的产业培育,不同维度的资源正在汇聚,共同推动这一前沿技术从实验室走向产业化。
vivago R1等产品的成功落地,证明了多模态AI已具备解决复杂商业场景的能力。未来,AI的竞争将不再局限于参数规模,而是谁能更好地“看懂”并“推演”物理世界。智象未来的演进节奏与落地效果,将为“大模型如何跨越纸上谈兵、真正走进物理世界”提供重要范本。随着世界模型牌桌的正式摆开,这场关于下一代AI基础设施的竞赛,才刚刚鸣枪。