397B参数如何追平万亿模型?上海AI Lab架构革新揭秘科学智能体新范式

1 阅读

突破算力焦虑:小参数与大智慧的架构重构

在人工智能模型竞赛中,参数规模的无限扩张曾被视为提升智能的唯一路径。然而,随着模型走向万亿参数级别,算力成本、能耗限制以及推理延迟成为难以逾越的鸿沟。上海人工智能实验室(上海AI Lab)在WAIC 2026发布的Intern-S2-Preview-397B,提供了一种截然不同的解题思路:通过底层架构的根本性革新,用397B的参数规模,在核心科学任务上追平甚至超越此前的万亿参数模型。这一突破不仅缓解了算力焦虑,更揭示了“效率”正成为基础模型竞争的新变量。

传统大模型往往面临“通用认知”与“专业知识”难以兼顾的困境。为了适应新领域,模型通常需要全量微调,这极易导致原有通用能力的退化,即所谓的“灾难性遗忘”。Intern-S2-Preview-397B的核心创新在于打破了这种耦合,构建了一个由Memory Decoder与Mobius组成的双引擎系统。这种设计将“记忆”与“思考”各司其职,使得模型能够在不扰动原有参数的情况下,像扩展外部硬盘一样快速接入新的专业知识。这种“通识为体、专业为用”的理念,为大模型的专业化演进开辟了一条可持续生长的新路径。

Mobius架构:解耦带来的效率革命

Mobius架构是Intern-S2-Preview-397B的心脏。它不同于传统的Transformer架构,通过解耦模型内部的知识向量与推理算子,实现了全局共享知识向量库的构建。这种设计带来了两个显著优势:一是提升了知识在层间的可复用性,实现了更优的知识压缩率;二是为不同推理算子提供了灵活的知识存取机制,使其能够根据输入动态组织计算路径。

更值得关注的是,Mobius架构原生引入了反向残差连接(Backward Residual Connection)与动态隐空间推理(Dynamic Latent Reasoning)机制。前者打破了浅层隐状态无法访问深层知识的限制,允许深层隐状态反向获取浅层信息,增强了信息的流动效率;后者则使用连续向量替代传统的Token,不仅提高了信息密度,更适合科学模态的表达,同时让模型能够动态分配推理开销,避免在简单任务上浪费算力。

这种解耦设计反而促进了记忆调用与推理过程的紧密协同。数据显示,在面对相同任务时,Intern-S2-Preview-397B的端到端推理效率提升了接近4倍。这意味着,模型不再需要为了记住一个知识点而重新计算整个网络的状态,而是可以精准地检索并应用相关推理逻辑。对于需要频繁调用专业工具、进行多轮规划的复杂科学任务而言,这种效率提升是决定性的。

训练范式升级:从文本拟合到交互验证

架构的创新需要配套的训练范式来支撑。传统大模型依赖静态语料进行概率拟合,难以习得复杂的决策逻辑和长程规划能力。为此,上海AI Lab构建了InternBootcamp交互验证环境。这一平台将电路设计、金融建模等真实任务转化为标准化的交互场景,并自动生成验证函数进行仿真核验。

在InternBootcamp中,模型不再是被动地学习文本分布,而是在“行动—反馈”的高密度训练中,通过试错来内化领域逻辑。这种类似强化学习的训练方式,从根本上强化了模型的长程规划与工具调用能力。例如,在药物研发场景中,模型需要根据实验反馈不断调整分子结构,这种动态调整过程在静态语料训练难以实现,但在交互验证环境中却能得到充分锤炼。

此外,InternBootcamp平台提供了从数据沉淀、Reward评估到安全对齐的一体化支撑,显著降低了打造专域模型的成本。这种训练范式的革新,使得Intern-S2-Preview-397B不仅仅是一个知识问答机器,更成为一个能够自主规划、迭代纠错的科研智能体。

科学实证:从0.47%到1.56%的突破

能力的优劣最终需由实证检验。在生命科学领域,Intern-S2-Preview-397B在Biology-Instructions、Mol-Instructions等专业评测中大幅领先其他开闭源旗舰模型。以免疫治疗靶点IL-7Rα的蛋白结合剂设计为例,传统流程中,科学家面对数千个候选分子,往往陷入“大海捞针”的困境,通过率低至0.47%,单轮验证耗时数日。

引入Intern-S2-Preview-397B后,模型能够深度学习全量反馈数据,将盲目试错转化为策略优化链。它精准地将43个关键残基精简至30个,并聚焦于核心表位,从源头上解决了结构不稳的问题。这一智能诊断过程将研发初期的参数调优环节压缩为分钟级。在同等算力下,AlphaFold3与Rosetta的验证通过率跃升至1.56%,增幅高达233%,可交付的优质候选分子数提升逾3倍。这不仅提升了研发效率,更降低了科学发现的门槛。

在材料科学方面,面对五元氧化物Sr₂Ho₁Cu₂Ru₁O₈这样复杂的晶体结构预测,模型仅需输入化学式,即可结合晶体学逻辑自动匹配空间群,系统化构建晶格参数。这种将“经验试错”向“模型驱动”转型的能力,使得科研人员能够站在更高、更准的起点开展后续研究。

平台化落地:构建可验证的科研闭环

技术突破的最终目的是服务于应用。上海AI Lab基于Intern-S2-Preview-397B打造了「书生·端砚」科学发现平台。该平台不做泛化的通用问答,而是深度学习各学科的研究范式与实验规范,系统整合了算力、数据、模型与实验平台。

「书生·端砚」覆盖了从“假设提出”到“实验验证”的完整科研流程。在生命科学领域,它对接AlphaFold、BLAST等专业工具;在材料科学中,打通Materials Project、RDKit及第一性原理计算接口;在地球科学中,接入遥感与地质专业模型。目前,该平台已在生命科学、关键材料、半导体、核聚变、量子及地球气象六大核心领域落地,并完成了干湿实验闭环验证。

这种平台化的落地,标志着科学智能从单点能力突破走向系统性基础设施的建设。它不再仅仅是一个辅助工具,而是成为了科研流程中的核心决策中枢,推动科学研究进入可验证、可复现、可迭代的新阶段。

视觉预训练:捕捉隐性结构信息

科学知识的载体远不止文字。分子构型、晶体坐标、实验谱线中蕴含了大量自然语言难以穷尽的信息。传统流程中,PDF文献解析为文本的过程极易导致版面结构、图表逻辑与公式语义的损耗。

Intern-S2-Preview-397B采用了视觉与语言深度互动的全新预训练范式。模型直接“阅读”原始文献页面,在同一表征空间内联合学习符号语义与图像信息关系,无需中间解析环节。这种多模态联合建模方式完整保留了图文对应关系,为高度依赖空间与图像推理的科学任务奠定了认知基础。

数据表明,相同科学文献经视觉编码生成的Token量仅为解析后文本的1/4。这种高信息密度的学习方式,在大幅降低训练开销的同时,让模型习得了更多对科学推理至关重要的隐性结构信息。这不仅是技术上的优化,更是认知方式上的升级,使AI能够更贴近人类科学家“看图说话、读图思考”的认知习惯。

展望:AI for Science的下一个前沿

随着AGI进入下一阶段,科学智能不再仅仅是AI的一个应用分支,而是检验智能能否理解复杂世界、提出可验证假设并在反馈中持续进化的终极试炼。Intern-S2-Preview-397B的发布,印证了大模型的进步不只来自参数规模的堆砌,更来自更合理的知识组织方式、更高密度的推理训练和更有效的计算路径。

未来,科学发现与AI推理将形成正向循环:大规模推理赋能科学发现,科学发现亦将反哺推理能力的进化。上海AI Lab的探索表明,通过架构创新与范式升级,我们有望打破算力与性能的线性依赖关系,开启面向科学发现的智能体基座新时代。这不仅是对“通专融合”理念的验证,更是为人类探索未知世界提供了一把更高效、更精准的钥匙。