397B参数如何追平万亿模型?上海AI Lab揭秘科学智能体新架构
在人工智能技术高速迭代的当下,追求更大的参数规模往往被视为提升模型能力的直接路径。然而,当算力成本、能源消耗以及边际效应递减成为行业共识时,架构层面的根本性创新成为了突破瓶颈的关键变量。2026年世界人工智能大会(WAIC 2026)上,上海人工智能实验室发布的Intern-S2-Preview-397B模型,提供了一份极具说服力的答卷:以397B的参数量,在核心科学任务上追平了此前万亿参数级别的模型表现。这一突破不仅标志着书生系列大模型在科学智能(AI4S)领域的重大进展,更揭示了通过底层架构重构,实现“小参数、大效能”的新范式。
传统大模型在面对科学领域复杂任务时,长期受制于通用认知与专业知识难以兼顾的困境。科学研究要求模型既要拥有海量的知识储备,又要具备灵活的逻辑推理能力,而在传统的Transformer架构中,知识存储与逻辑推理往往是高度耦合的。这种耦合导致模型在吸收新学科知识时,容易扰动原有的通用能力,且无法高效利用已有知识进行深层推理。为了解决这一痛点,上海人工智能实验室从底层架构入手,提出了一种全新的解耦思路,即通过非Transformer架构的“Mobius”,将知识存储与逻辑推理分离,形成由Memory Decoder和Mobius引擎组成的双驱动核心。
在这一架构中,Memory Decoder引入了专业领域的可插拔外部记忆模块。这种设计使得不同学科的最新知识可以在独立的模块中训练,并根据任务需求按需接入基础模型。这种机制类似于人类大脑的海马体,允许模型在吸收垂域知识时,尽量减少对原有参数和通用能力的干扰。换言之,专业知识不再需要通过反复改写整个模型来“硬编码”,而是像扩展记忆一样持续更新,从而及时校正模型在探索未知过程中对新信息的理解偏差。这种轻量级的知识更新方式,为科学智能体的持续进化提供了坚实的基础。
Mobius架构则专注于基座模型内部的知识与推理分离。通过解耦模型内部的知识向量与推理算子,Mobius构建了全局共享的知识向量库。这一设计不仅提升了知识在层间的可复用性,带来了更好的知识压缩率,还为不同推理算子提供了灵活的知识存取机会。模型可以根据输入动态组织计算路径,使得数学、物理、化学、生物等领域共有的分析、验证和纠错能力得以迁移复用。专业能力因此不再是彼此割裂的“技能孤岛”,而是成为同一基座上可组合、可协同的能力单元。
值得一提的是,Mobius的设计原生引入了反向残差连接(Backward Residual Connection)机制与动态隐空间推理(Dynamic Latent Reasoning)机制。反向残差连接打破了传统模型中只有浅层隐状态可以访问深层知识的约束,让深层隐状态也能获取浅层知识,增强了信息的流动与整合。动态隐空间推理则使用连续向量替代传统的Token,提供了更高信息密度的信息载体,特别适合科学模态的表达。模型能够根据输入动态分配适当的推理开销,从而在保证精度的同时提升效率。这种“解耦”设计反而让记忆调用与推理过程更加紧密地协同,使模型在面对相同任务时的端到端推理效率提升了接近4倍。
为了进一步验证这一架构的有效性,研发团队构建了InternBootcamp交互验证环境。不同于传统的依赖静态语料训练,InternBootcamp将电路设计、金融建模等真实任务转化为标准化的交互场景,并自动生成验证函数进行仿真核验。在这种“行动—反馈”的高密度训练中,Intern-S2-Preview-397B不再是对文本概率的简单拟合,而是在试错中内化领域逻辑。这种训练范式不仅降低了模型打造的成本,更使得模型的长程规划与工具调用能力得到根本性强化,为其在复杂科学任务中的表现奠定了坚实基础。
在科学专业任务的评测中,Intern-S2-Preview-397B展现了显著的优势。在Biology-Instructions、Mol-Instructions、MP20等涉及生命科学和材料结构理解、生成与设计的专业任务中,该模型大幅领先其他开闭源旗舰模型。这表明,Intern-S2-Preview已经具备了服务科学研究所需的专业基础能力,能够处理高精度、高复杂度的科学问题。此外,在软件工程开发的主流评测如TerminalBench2.1和SWEBench-Pro上,该模型在开源模型中表现优异,仅次于部分顶级闭源模型,印证了其在通用智能体能力上的提升。
科学发现的核心在于将一次推理转化为可验证、可复现、可迭代的完整工作流。Intern-S2-Preview-397B通过将通用理解、专业推理、结果诊断与工具调用收束于同一基座,实现了从“给出答案”到“解释依据并提出方案”的跨越。以免疫治疗靶点IL-7Rα的蛋白结合剂设计为例,传统流程中,科学家每轮筛选需生成上千个候选分子,并通过AlphaFold3折叠预测与Rosetta能量筛选进行层层剥离。由于缺乏全局视角的精准引导,大量候选分子因结构不稳或界面质量不佳被淘汰,通过率低至0.47%,单轮闭环耗时数日。
依托Intern-S2-Preview-397B作为智能决策中枢,科研人员可以将原本“盲目试错”的过程转化为可审阅的“策略优化链”。模型能够深度学习实验的全量反馈数据,提供针对性的设计改进建议。例如,模型建议将分散的43个关键残基精简至30个,并聚焦于特定核心表位,从源头上解决了蛋白分子结构不稳的难题。在同等算力预算下,基于该模型的优化策略,AlphaFold3与Rosetta的验证通过率由0.47%跃升至1.56%,增幅高达233%,可交付的优质候选分子数提升逾3倍。这一过程将原本以天计的人工经验迭代,压缩为分钟级的智能诊断与精准重跑,极大地加速了药物研发的进程。
在材料科学领域,Intern-S2-Preview-397B同样展现了强大的决策支撑能力。对于五元氧化物Sr₂Ho₁Cu₂Ru₁O₈这类复杂化合物,随着元素种类增加,晶体结构的组合可能性呈指数级爆炸。预测五种原子在三维空间内的相互位置,是对模型空间推理能力与晶体学知识内化程度的极大考验。通过输入化学式,模型即可结合晶体学逻辑,自动匹配空间群,并从晶格参数、晶胞体积到原子分数坐标进行系统化构建。这一过程将研发初期最耗时的“结构探索”环节转化为模型驱动的“精准构建”,让后续的高阶科学研究能够站在一个更高、更准的起点,真正实现从“经验试错”向“模型驱动”的研发模式转型。
基于Intern-S2-Preview-397B的强大能力,上海人工智能实验室打造了「书生·端砚」科学发现平台。该平台面向真实科研全流程,承载从“假设提出”到“实验验证”的完整科学发现流程推演、记录、验证与沉淀。平台不以泛化通用问答为目标,而是深度学习各学科的研究范式、实验规范及专业工具接口。在生命科学领域,平台可对接AlphaFold、BLAST、UniProt;在材料科学领域,打通Materials Project、RDKit及第一性原理计算;在地球科学领域,接入遥感及地质专业模型。目前,「书生·端砚」已在生命科学、关键材料、半导体、核聚变、量子及地球气象六大核心科研领域落地,并在蛋白质、材料等前沿研究中完成了干湿实验闭环,实现了科学发现全流程的端到端验证。
科学知识的载体远不止文字。分子构型、晶体坐标、实验谱线与复杂公式图表中,蕴含了大量自然语言难以穷尽的信息。单纯依赖文字输入难以实现完整的智力涌现,也无法从根本上解决科学智能的深层问题。针对这一挑战,Intern-S2-Preview-397B采用了视觉与语言深度互动的全新预训练范式。传统流程中,复杂的PDF文献需预先解析为纯文本,这一过程极易导致版面结构、图表逻辑与公式语义的损耗。而新范式让模型从一开始就直接“阅读”原始文献页面,在同一表征空间内联合学习符号语义与图像信息关系,不依赖中间解析环节。这种多模态联合建模方式完整保留了图文对应关系,显著提升了语料利用效率。数据显示,相同科学文献经视觉编码生成的Token量仅为解析后文本的1/4,使得模型能以极高的信息密度学习复杂知识,大幅降低训练开销的同时,习得更多对科学推理至关重要的隐性结构信息。
随着人工智能向AGI阶段迈进,科学智能不再仅仅是AI的一个应用分支,而是检验智能能否理解复杂世界、提出可验证假设并在反馈中持续进化的终极试炼。Intern-S2-Preview-397B的发布,不仅是对这一命题的积极探索与回应,更揭示了大模型进化的新方向:当参数扩张面临算力与成本约束时,架构效率正在成为基础模型竞争的新变量。通过让大模型的“记忆”与“思考”各司其职、完美协同,上海人工智能实验室印证了模型进步不只来自“更多参数”,也可以来自更合理的知识组织方式、更高密度的推理训练和更有效的计算路径。这一成果也为国产算力基础设施与模型能力的协同演进提供了重要参考,开启了面向科学发现的智能体基座时代。