3个月狂揽21亿,合肥为何赌上多模态视觉大模型?
资本重注背后的范式转移
2026年7月23日,AI领域发生了一件引发行业震动的事件:多模态大模型公司智象未来(HiDream.ai)宣布完成15亿元人民币的C轮融资。这笔资金并非孤立存在,而是这家初创公司在过去三个月内完成的第三轮融资。至此,智象未来在短期内累计融资超过21亿元,估值正式突破10亿美元大关,成为全球AI版图中又一颗耀眼的独角兽。
然而,在一级市场趋于冷静的当下,单纯的资金规模已不足以成为新闻焦点。真正值得推敲的,是这笔钱背后的出资人结构。本轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视等十余家机构跟投。老股东合肥产投、东方富海、金浦投资等也持续加注。
这种国资、产业资本与顶级市场化VC罕见“神仙打架”式的扎堆现象,折射出资本市场对AI行业未来走向的深刻共识:大语言模型(LLM)的估值红利正在见顶,而视觉与多模态赛道正迎来价值重估的黄金窗口。合肥产投作为连续押中长鑫科技、京东方等硬科技项目的“最牛风投城市”代表,此次再次出手,无疑为这一判断增加了极具分量的注脚。
从“规模法则”到“物理智能”的技术拐点
要理解资本为何集体转向多模态,必须回到AI行业当前的技术瓶颈期。过去三年,AI发展的核心叙事是“规模法则”,即认为只要参数足够大、数据足够多,模型就能产生智能。然而,随着开源模型的密集发布和能力的快速迭代,通用文本模型的领先窗口急剧缩短,单纯依靠堆砌参数带来的边际效应递减已是不争的事实。
与此同时,以杨立昆(Yann LeCun)为代表的顶尖科学家提出,LLM本质上是“书斋里的思想家”,其智能局限于人类编码的符号系统之内,缺乏对物理世界的真实理解。世界模型(World Models)的概念由此兴起,旨在让AI不仅处理符号,更能理解空间、时间、因果和交互。
这一理论判断正在迅速转化为市场现实。2026年,国内AI视觉领域的融资总额已逼近300亿元。字节系的Seedance、可灵ARR数据大幅增长,独立创业公司接连落地大额融资。市场共识逐渐形成:多模态已成为自AI Coding之后,商业化确定性最高的赛道之一。资本的目光从“现在能做什么”移向“未来能成为什么”,视觉模型的想象空间被彻底打开。
UiT架构:颠覆“缝合怪”的原生全模态路径
在众多追逐多模态的企业中,智象未来之所以能脱颖而出,核心在于其底层架构的差异化选择。传统的多模态模型往往采用“缝合架构”,即在语言模型之外外挂图像或视频模块,各模态分别编码,最后在外层拼接。这种架构不仅导致信息在模态转换中的损耗,也难以实现真正的深度交互。
智象未来选择了更具挑战性的UiT架构,试图构建原生全模态模型。该架构的核心逻辑是:图像像素、文本Token、视频体素及音频、动作等原始信号,由同一套Transformer完成理解、生成和推理。它不设独立的文本编码器,也不用VAE作为模态间的传导介质,而是将所有信号统一tokenization,端到端地在同一网络中处理。
这一架构的优势在于,它打破了模态间的壁垒,实现了文生图、长文本渲染、指令编辑、主体驱动等任务的全能覆盖。这种设计更贴近人类认知的多感官整合过程,为AI理解物理世界奠定了坚实基础。
技术验证:从开源榜首到全球前三
理论的创新需要数据的验证。2026年5月,智象未来的技术实力在第三方评测中得到了初步印证。其旗下HiDream-O1-Image(8B参数开源版本)以匿名身份“Peanut”参与全球知名平台Artificial Analysis的评测,并登上文生图榜单开源模型第一,成为榜单前20名中参数最小的模型。
随后,商用版HiDream-O1-Image-1.5再次刷新记录,位列全球前三。在光影表现、复杂构图、指令跟随以及中英文渲染等关键指标上,该模型展现出超越同侪的能力。虽然评测排名的变动周期已从季度缩短至月度,但这标志着一条技术路线已在实际应用中交出了可被验证的答卷,证明了原生全模态路径的可行性。
商业化落地:vivago R1与“荒诞”风格的试金石
对于AI创业公司而言,技术最终必须转化为生产力。智象未来构建了“1+1+3”的商业化体系:底层是HiDream全模态大模型底座,中层是HiHarness企业能力中台,顶层则聚焦商业营销、影视创作、社媒创作三大垂直场景。
其中,本次WAIC重磅发布的vivago R1多模态创作智能体,被视为技术落地的核心标杆。针对行业长期存在的视频生成时长受限、画面跳变、人设错乱等痛点,vivago R1引入了长链路叙事规划能力。它摒弃了传统的“抽卡式”随机生成,先进行整体脚本与镜头规划,再分段落地生成并智能纠错。这一创新将AI内容商用有效成功率提升至85%,跨越了企业规模化商用的门槛。
产品的真实能力通过一个极具挑战性的用户测试案例得以体现。有创作者要求生成一部“叶什尔查姆风格”的荒诞科幻短片。叶什尔查姆是土耳其上世纪的商业电影风格,以低成本、粗粝道具和夸张表演著称,如《土耳其星战》中硬纸板做的怪兽、泡沫石头道具等。
这种风格对AI的要求极高:模型既要理解物理规则,又要刻意保持“廉价感”,并在“假”与“可笑”之间精准踩中风格阈值。大多数模型倾向于输出美观但风格错误的画面,而vivago R1成功复现了硬纸板怪兽、手绘背景等质感,同时保持了镜头叙事的连贯性。这一案例证明,真正的创作工具不仅要生成漂亮画面,更要理解风格、执行意图并保持逻辑连贯。
全球视野与合肥模式的双重共振
vivago R1的商业化成绩同样亮眼。其海外版已覆盖全球100多个国家和地区,服务用户超5000万,并于2026年5月在Product Hunt登顶日榜第一。硅谷知名Product Hunter Chris Messina评价其为“视频领域的Claude Code”。这一全球认可,不仅验证了技术的通用性,也表明国产AI在底层架构上的突围具备国际竞争力。
与此同时,合肥产投等地方国资的介入,体现了“合肥模式”在AI时代的延续。合肥擅长在行业黎明期下重注,通过资本纽带吸引产业链集聚。此次投资智象未来,不仅是财务投资,更是合肥在AI视觉赛道布局标志性项目的战略举措。上影股份、华策影视等影视巨头的入局,则标志着内容产业开始前置卡位AI革命,双方将在内容创制、院线场景升级、AI制片标准等领域展开深度合作。
结语:物理世界的入场券
随着智象未来融资尘埃落定,世界模型的牌桌正式摆开。这场竞赛的本质,是从文本智能向物理智能的范式跃迁。智象未来通过UiT架构的原生全模态探索,为“大模型如何跨越纸上谈兵、真正走进物理世界”提供了一个值得挖掘的范本。
在多模态赛道,竞争才刚刚进入深水区。对于投资者和行业观察者而言,关注点应从单纯的融资规模转向技术架构的鲁棒性、场景落地的深度以及全球市场的拓展能力。智象未来的案例表明,在AI的下半场,唯有那些能真正理解物理世界、并具备高效商业化能力的玩家,才能赢得长期的胜利。