合肥再押AI独角兽:智象未来3月融21亿,原生全模态破局

0 阅读

在人工智能浪潮的演进中,资本的流向往往是最敏锐的风向标。当大语言模型(LLM)的参数竞赛逐渐触及工程天花板,市场对于单纯依靠文本交互和代码生成的估值逻辑开始产生分歧。就在这一关键拐点,一家名为智象未来(HiDream.ai)的企业,以惊人的速度完成了资本市场的三级跳。短短三个月内,三轮密集融资总额超过21亿元人民币,最新一轮C轮融资达15亿元,使其估值正式突破10亿美元大关,跻身全球AI独角兽行列。这一现象级事件背后,并非简单的资金堆砌,而是标志着AI行业重心正从“文本智能”向“物理智能”发生根本性转移。

此次融资阵容的豪华程度,在近年来的一级市场中极为罕见。领投方包括社保基金四川振兴科创基金、工银资本等国家级资本,以及弘颐资管、敦鸿资本等顶级市场化机构。更值得注意的是,这是社保基金作为LP首次涉足多模态大模型领域,也是工银资本第一次出手该赛道企业。与此同时,上影股份、华策影视等头部影视产业资本,以及合肥产投、厦门国贸等地方国资纷纷跟投。这种横跨国家战略、产业落地与财务回报的多元化资本结构,折射出不同背景的投资人对同一技术叙事的高度共识:多模态,尤其是基于视觉的世界模型,正在成为下一代AI基础设施的核心组成部分。

为何资本在此时集体转向视觉赛道?核心原因在于LLM的边际效应递减。过去几年,市场习惯于为更大的参数规模、更高的Benchmark分数支付溢价。然而,随着开源模型的密集发布,通用文本能力的领先窗口期被极度压缩,单纯“做大模型”已难以构建稳固的护城河。相比之下,AI视觉赛道呈现出截然不同的增长曲线。2026年国内AI视觉领域融资总额逼近300亿元,显示出技术落地与商业兑现的黄金周期已经到来。视觉信息承载着物理世界的空间、时间、因果与交互逻辑,其信息密度远高于文本。谁能更高效地理解并生成视觉内容,谁就掌握了通往通用人工智能(AGI)的另一把钥匙。

智象未来的核心竞争力,在于其颠覆性的技术架构选择。传统多模态模型大多采用“缝合架构”,即在语言模型基础上外挂图像编码器和生成模块,各模态独立编码后在外层拼接。这种模式在信息传递过程中存在严重的损耗,且难以实现真正的模态间深度融合。智象未来推出的UiT(Unified Transformer)架构,则试图从底层重构这一范式。该架构不设独立的文本编码器,也不依赖VAE作为模态间的传导介质,而是将图像像素、文本Token、视频体素以及音频、动作等原始信号统一进行Tokenization,由同一套Transformer网络完成端到端的理解、生成与推理。

这种原生全模态架构的优势在于,它让模型能够像人类一样,直接通过视觉像素感知物理世界。一张图片所蕴含的光影变化、物体材质、空间关系,不再需要经过复杂的转译,而是直接作为基础信号进入模型神经网络。这意味着,文生图、长文本渲染、指令编辑、主体驱动乃至故事板生成,均由同一个模型内核处理,极大地提升了多任务处理的连贯性与一致性。2026年5月,智象旗下HiDream-O1-Image(8B参数开源版本)在知名独立AI模型评测平台Artificial Analysis上登顶文生图榜单开源模型第一,成为前20名中参数最小的版本。随后,其商用版更是位列全球前三,证明了小参数原生架构在特定垂直领域的巨大潜力。

技术的先进性最终需通过商业化落地来验证。智象未来构建了“1+1+3”的商业化体系,即一个全模态大模型底座、一个企业能力中台HiHarness,以及聚焦商业营销、影视创作、社媒创作三大场景的智能体产品。其中,WAIC重磅发布的vivago R1多模态创作智能体,被视为技术落地的标杆。针对行业长期存在的视频生成时长受限、画面跳变、人设错乱等痛点,vivago R1引入了长链路叙事规划能力。它摒弃了传统的“抽卡式”随机生成,转而采用先规划脚本与镜头,再分段生成、智能纠错的模式。单段任务失败可独立重试,不影响整体进度,从而将AI内容商用的有效成功率提升至85%以上,跨过了企业规模化应用的核心门槛。

一个极具说服力的案例来自创作者社群对vivago R1的压力测试。用户要求生成一部“叶什尔查姆风格”的荒诞科幻短片。叶什尔查姆是土耳其上世纪六七十年代的电影黄金时代,其后期低成本山寨片以粗粝道具、拼贴素材和夸张表演著称,如《土耳其星战》中真人穿着硬纸板怪兽服、使用泡沫塑料道具等。这种风格要求模型不仅要理解物理规则,更要刻意保持“不完美”的廉价质感,并在“假”与“可笑”之间精确把握风格阈值。大多数模型倾向于输出“美观”的画面,而vivago R1却精准复现了硬纸板怪兽、手绘背景及廉价特效的荒谬感,同时保持了镜头叙事的连贯性。这一案例证明,真正的创作工具必须具备深层的风格理解与意图执行能力,而非仅仅生成漂亮的单帧图像。

目前,vivago海外版已覆盖全球100多个国家和地区,累计服务超5000万用户,并在Product Hunt日榜登顶,被硅谷专家评价为“视频版的Claude Code”。这一成绩表明,中国AI企业在底层架构创新与产品化能力上,已具备参与全球竞争的实力。从合肥这座城市来看,其继长鑫科技、京东方之后,再次在行业黎明期重注智象未来,延续了其擅长捕捉硬科技风口的投资哲学。地方国资、产业资本与市场化VC的协同,不仅提供了资金支持,更带来了丰富的应用场景与产业链资源,加速了技术从实验室走向生产线的进程。

展望未来,AI竞赛的本质已从“读懂人类已有知识”转向“看懂并推演物理世界”。杨立昆曾预言世界模型将取代LLM成为主流,虽然这一判断尚待时间检验,但智象未来的实践表明,基于视觉的原生全模态路径是一条可行且充满潜力的方向。随着算力成本的降低与算法效率的提升,世界模型有望在自动驾驶、机器人控制、虚拟制片等领域发挥更大作用。对于行业而言,关注点应从单纯的参数规模竞争,转向对物理世界建模能力的深度挖掘。智象未来的崛起,不仅是一家企业的成功,更是中国AI产业在底层架构创新上的一次重要突围,为全球AGI探索提供了具有参考价值的中国样本。在这场从文本到物理的范式跃迁中,真正的竞赛才刚刚鸣枪,而那些能够真正理解并重构物理世界逻辑的企业,终将定义下一个智能时代。