AI范式大转向:为何科学数据将取代语言成为下一代基础模型的核心?
人工智能的发展史,本质上是一部数据范式的演进史。当我们站在2026年的节点回望,会发现整个行业正站在一个关键的十字路口。过去三年,尽管大模型的参数量指数级增长,Agent的自主性日益增强,长上下文处理能力不断突破,但核心讨论始终局限于模型架构、算力规模以及通往通用人工智能(AGI)的距离。然而,一场更为深刻的变革正在悄然酝酿:真正推动人工智能发生质变的,或许不再是更大规模的神经网络,而是数据本身的形态与内涵。中国工程院院士、之江实验室主任王坚在WAIC 2026主论坛上抛出了一个极具颠覆性的观点:人工智能正在迎来新的范式转折,未来的基础模型将不再仅仅依赖于语言数据,而是以科学数据为“原住民”。这一论断不仅重新定义了基础模型的技术边界,更揭示了AI从“理解人类语言”走向“理解自然世界”的根本路径。
要理解这一转折的必然性,我们需要追溯人工智能发展的底层逻辑。在公众的认知中,深度学习的崛起往往被归功于英伟达的GPU算力爆发或Transformer架构的算法创新。但若将时间拨回2012年,真正点燃深度学习革命的,是ImageNet数据集的大规模标准化发布。正是ImageNet提供了足够规模、结构清晰的数据土壤,让卷积神经网络得以生根发芽,进而吸引资本与技术资源涌入。英伟达对算力的信仰,实则是对数据驱动智能这一趋势的精准押注。这一历史规律表明,每一次智能能力的跃迁,看似源于算法的精妙,实则得益于数据范式的突破。从ImageNet重塑计算机视觉,到互联网文本催生GPT系列语言模型,数据的形态决定了智能的上限。当基于语言数据的大模型逐渐触及信息熵的瓶颈,寻找新的数据源泉成为行业共识。
当前广泛被视为“基础模型”的大语言模型(LLM),尽管在代码生成、逻辑推理和多模态理解上表现惊艳,但其本质仍局限于“Large Language Model”。无论模型如何扩展其能力边界,它们感知世界的窗口依然是文本。这意味着,模型所掌握的知识,实际上是人类已经用语言符号化、结构化后的“二手知识”。然而,自然界中蕴含的绝大部分信息,并未以文本形式存在。在地球科学、天文学、生物学等领域,决定科研突破的核心数据往往隐藏在光谱信号、遥感影像、地震波形、基因序列以及天文观测记录中。据王坚分析,在地球科学领域,超过70%的关键信息并不存在于论文文本中,而是直接编码在原始观测数据里。如果模型仅仅阅读科学家总结出的结论,它就永远无法触及自然规律的本质。正如“一张图片胜过千言万语”,一段原始的光谱数据,其蕴含的信息密度远超千万张图片。未来的突破,在于让模型直接学习科学数据,而非仅仅学习关于数据的描述。
科学基础模型(Scientific Foundation Model)的提出,并非要建立一个服务于特定垂直领域的专用模型,而是旨在构建一种新的通用基础架构。与当前基于文本的基础模型不同,科学基础模型需要在一个统一的表示空间中,同时融合文本、代码以及多维度的科学数据。这种融合的关键技术难点在于对科学数据完成高效的Tokenization。只有当不同类型、不同量级的科学数据被转化为机器可统一处理的标记序列时,科学数据才能摆脱“外部资源”的身份,真正成为基础模型内部的“第一公民”。这种技术范式的转换,使得模型能够直接捕捉自然规律中的隐性关联,而非仅仅复现人类已有的知识图谱。这一转变的意义,类似于当年从非结构化数据向结构化数据集的跨越,它将重新定义AI处理复杂系统问题的能力。
这一理论并非空中楼阁,已有先锋案例证明了其巨大的现实价值。由之江实验室与南京大学联合研发的GeoGPT,便是一个典型的“科学基础模型”实践。GeoGPT致力于解决地球科学中的核心难题:让石头“开口说话”。地球科学的复杂性在于其数据体系极其庞大且非线性,每一块岩石、每一层地层都记录着地球数十亿年的演化历史。传统研究受限于化石记录的不完整性,面临著名的Signor-Lipps效应挑战,即化石发现的随机性导致物种灭绝时间的判定存在巨大误差。GeoGPT通过深度学习十万多个生物种类和两万多个地层剖面的科学数据,首次构建了全球最完整、最精确的生命演化时间轴,将时间精度从百万年提升至万年尺度。这一成果并非简单的数据挖掘,而是模型通过理解原始科学数据,揭示了人类经验难以察觉的演化规律。
更令人瞩目的是,科学数据的价值在于其“可复用性”与“发现能力”。2024年底,一位18岁高中生利用退役小行星卫星的遗留数据,重新进行分析,发现了近150万个此前未被编目的天体。这一案例生动地说明,新的科学发现未必依赖于新设备的投入,而往往源于旧数据与新模型的结合。当基础模型具备直接处理科学数据的能力时,它将极大地降低科学发现的门槛,激发跨界创新。科学家不再需要精通所有数据处理的代码细节,而是可以通过自然语言或高层语义指令,让模型直接挖掘数据背后的自然规律。这种协作模式,将彻底改变科研工作的组织方式与效率。
展望未来,人工智能的角色将从“工具”转变为“基础设施”。数学是所有科学共同的语言,而未来的人工智能,也将成为科学研究的底层支撑。如果说过去的大语言模型改变的是人类获取和整理知识的方式,那么科学基础模型改变的将是人类创造知识的方式。当模型能够直接“阅读”自然世界的数据时,它将不再只是被动地响应人类指令,而是主动参与假设生成、规律探索甚至理论构建。这种从“语言智能”向“科学智能”的跃迁,是通向真正AGI的关键一步。因为人类智能的高级形态,恰恰体现在对客观世界规律的深刻理解与抽象上,而非仅仅是对符号系统的操作。
当然,实现这一愿景仍面临诸多挑战。科学数据的异构性、噪声处理、物理一致性约束等问题,都需要新的算法架构来解决。同时,如何确保模型在推理过程中的可解释性,防止其陷入“幻觉”并违背基本物理定律,也是亟待解决的技术伦理问题。但这并不妨碍我们确信,科学数据将成为下一阶段AI竞争的核心高地。各国在AI领域的竞争,终将演变为对高质量科学数据资源的争夺,以及构建能够高效利用这些数据的基础模型能力的比拼。
王坚院士的观点为整个行业指明了新的方向:不要仅仅卷模型的参数规模,而应关注数据质的飞跃。让科学数据成为基础模型的“原住民”,意味着AI将走出人类语言的封闭圈层,进入广阔而复杂的自然世界。这不仅是一次技术路线的调整,更是一场认知范式的革命。当AI真正开始理解光谱背后的化学键,理解地震波深处的板块运动,理解基因序列中的生命密码时,它才真正具备了探索未知、拓展人类知识边界的潜力。这不仅是AI迈向AGI的必经之路,也是人工智能回馈科学、推动文明进步的最大价值所在。在这一新范式下,每一个科学数据的颗粒,都可能成为触发下一次科学革命的火花。