AI推动数据基础设施升级,国产数据库拓展新边界

0 阅读

AI进入下半场,数据成了新瓶颈

过去几年,AI行业的焦点几乎全在大模型和算力上。谁家模型参数更大、推理更快、支持更多语言,谁就站在聚光灯下。但到了2026年,风向变了。

文章配图

在9月10日的外滩大会《数智进化:让多模态数据成为AI核心燃料》论坛上,IDC中国企业软件市场研究经理王楠指出,现在大多数企业用的大模型,能力其实已经“够用”了。真正卡住AI落地的,不是模型不够强,而是企业自己的数据能不能被AI有效调用。

文章配图

换句话说,AI竞赛正在从“有没有好模型”,转向“有没有好数据”。

这背后有两个现实:一是数据量在爆炸式增长。IDC预计,中国每年产生的数据将从2025年的76ZB涨到2030年的146ZB;二是数据形态越来越复杂——除了传统的表格数据,还有大量PDF、图片、音视频、日志文件,甚至AI生成的向量数据。这些非结构化或半结构化数据,传统数据库根本处理不了。

更关键的是,生成式AI和智能体(Agent)对数据的要求完全不同。它们不仅需要“存得下”,还要能“实时查、自动理解、安全调用”。比如一个客服Agent,可能要同时读取用户的历史订单(结构化)、聊天记录(文本)、上传的发票照片(图像),再结合知识库做判断。这种场景下,老一套的数据架构就显得力不从心了。

数据基础设施正在整体升级

很多人以为“AI数据基础设施”是个全新市场,其实不然。它更像是传统数据栈的一次全面进化。

IDC把这一领域分成三块:AI数据平台、AI数据智能和AI数据服务。其中,AI数据平台是底座,负责统一存储和管理多模态数据;AI数据智能用AI技术提升数据治理和分析效率;AI数据服务则从一次性标注转向持续的知识库运营、合成数据生成等。

按IDC预测,2025年中国这个市场的规模约149亿美元,到2030年将达738亿美元,年复合增速37.7%。到2035年,甚至可能冲到1548亿美元——比2025年翻十倍不止。其中增速最快的是AI数据智能,五年复合增长率达48.2%。

这场升级的核心逻辑,是构建一个从“数据管理→数据智能→数据服务→Agent消费”的闭环。而实现路径,很可能是“小模型+多模态底座”:用行业知识微调轻量模型,配合能处理各类数据的统一平台,实现高效、可控的AI落地。

这意味着,原来的数据库、数据湖、数据仓库不能只盯着交易和报表了。它们必须支持向量检索、文档解析、实时流处理,还要能和AI推理过程无缝衔接。比如Agent在运行中产生的中间数据、决策日志,也需要被记录、分析、反馈回系统——这又催生了新的数据管理需求。

国产数据库的新机会

对国产数据库来说,这是一次难得的弯道超车机会。

过去十几年,国产数据库主要在金融、电信等关键行业替代Oracle、DB2,解决的是“核心系统能不能跑稳”的问题。目标很明确:高可用、强一致、高性能。但现在,AI带来了新角色——数据库不仅是业务系统的后台,更是AI和Agent的“数据粮仓”。

OceanBase就是个典型例子。它最早以分布式关系型数据库起家,在银行核心系统里证明了自己。但现在,它正通过Lakebase能力,把数据库、开放存储、分析引擎和多模态处理融合在一起,打造一个能同时处理结构化表、JSON日志、PDF文档和向量数据的统一底座。

更进一步,OceanBase还推出了DataPilot这样的Data Agent功能。简单说,就是让AI直接参与数据操作——业务人员不用写SQL,用自然语言就能查数据、做分析。Agent也能自动调用数据接口,完成复杂任务。这相当于把数据能力从IT部门释放给一线员工和智能程序。

这种转变,不只是产品功能的叠加,更是价值边界的扩张。以前数据库的价值体现在“保障业务连续性”,现在则体现在“驱动智能决策”。从服务核心交易系统,到支撑全量数据资产,再到成为Agent的运行基础,数据库的角色正在被重新定义。

小模型+多模态底座成关键路径

值得注意的是,这场变革并不依赖超大模型。相反,IDC强调,“小模型+多模态底座”才是企业落地AI的务实路径。

大模型虽然通用,但成本高、难控制、响应慢。而针对具体场景微调的小模型,配合高质量的行业数据底座,反而更容易产出可解释、可审计、可迭代的AI应用。比如在保险理赔中,一个专门训练的图像识别小模型,配合包含历史案例、条款文档、客户信息的统一数据平台,就能快速判断是否赔付。

这就要求数据基础设施不仅能存数据,还要能“喂”数据——把分散在各处的结构化记录、扫描件、通话录音、知识图谱,整理成小模型能吃的“饲料”。同时,整个流程必须满足合规要求,比如数据脱敏、访问审计、结果追溯。

OceanBase的做法是,在底层统一存储的基础上,通过内置的向量引擎支持语义检索,通过开放格式兼容各类非结构化数据,并通过Data Agent实现自然语言交互。这样,企业不用推倒重来,就能在现有数据资产上快速构建AI应用。

市场空间远超传统数据库

最后看一组数字:传统企业级数据库市场,全球也就几百亿美元规模。而仅中国AI数据基础设施市场,2030年就将达到738亿美元,2035年逼近1550亿。这还不包括全球市场。

对国产数据库厂商而言,这意味着一个比过去大得多的机会。不再是“替代国外产品”,而是“定义下一代数据平台”。谁能率先打通多模态数据管理、AI增强分析和Agent集成,谁就可能成为新生态的主导者。

当然,挑战也不小。技术上要融合数据库、搜索、AI框架;产品上要平衡通用性和行业特性;生态上还要和模型厂商、应用开发商协作。但有一点很明确:AI不会等数据基础设施慢慢准备。企业已经急着要用自己的数据跑AI了,市场窗口正在打开。

所以,与其说这是数据库的延伸,不如说是一场重构。数据基础设施正在从“支撑系统”变成“智能引擎”,而国产厂商,这次站在了同一起跑线上。