UniTS框架突破:AI如何自动构建复杂化学反应的过渡态结构?

2 阅读

在计算化学领域,过渡态(Transition State)始终是理解反应本质的核心。它位于反应势能面上的一阶鞍点,代表反应物转化为产物必须跨越的能量壁垒。尽管其存在时间极短,无法被实验直接观测,但过渡态的几何结构和能量决定了反应是否可行、速率快慢以及产物分布。因此,准确定位过渡态不仅是理论化学的基础任务,更是催化剂设计、药物合成路径优化和新材料开发的关键前提。

图片

然而,传统方法在寻找过渡态时面临巨大挑战。研究人员通常需要先手动构建一个接近真实鞍点的三维初始结构,再通过密度泛函理论(DFT)等量子化学方法进行优化。这一过程高度依赖化学直觉和经验,尤其在处理包含过渡金属、大型配体、自由基或多手性中心的复杂体系时,微小的构象偏差就可能导致优化失败或收敛至错误路径。这种对专家知识的强依赖,严重制约了反应机理研究的自动化与规模化。

图片

为突破这一瓶颈,上海科学智能研究院联合格物智研与复旦大学团队提出了一套名为 UniTS 的统一自动化框架,首次实现了从简单2D分子图到复杂3D过渡态结构的端到端生成。该工作发表于《Nature Communications》,标志着AI驱动的反应机理探索迈入新阶段。

图片

构建真实世界复杂度的过渡态数据库 UniTS-Lib

图片

高质量训练数据是生成模型成功的基石。然而,与稳定分子不同,经过严格验证的过渡态数据极为稀缺。现有公开数据集如Transition1x主要覆盖小分子、简单反应,难以反映真实有机合成中的复杂性。为此,研究团队从346篇机理研究论文的补充材料中提取原始坐标信息,开发了一套自动化数据处理流程。

图片

该流程首先将文献中的原子类型与三维坐标标准化为量子化学输入格式,随后在统一的DFT水平(B3LYP-D3(BJ)/def2-SVP)下进行过渡态优化与频率分析。关键创新在于引入分子图匹配验证机制:不仅要求结构具有单一虚频(一阶鞍点特征),还必须确保该虚频对应的振动模式确实引发目标键的形成或断裂,而非无关的构象变化。

图片

经过多轮筛选,团队最终构建了包含4391个高质量过渡态的 UniTS-Lib 数据库。其复杂度远超现有数据集:涵盖42种元素(最高至金),包含中性、离子及自由基体系;原子数中位数达50,最大体系含231个原子;广泛涉及氧化加成、转金属化、环加成等十余类重要反应类型,并包含铁族、铂族等催化常用金属。值得注意的是,初始提取的10000余个候选结构中近60%因优化失败或验证不通过被剔除,凸显了复杂过渡态数据的稀缺性与生成高质量初始结构的重要性。

高阶等变扩散模型 UniTS-Gen:从2D到3D的智能跃迁

基于UniTS-Lib,团队开发了过渡态生成模型 UniTS-Gen。与多数需输入反应物与产物3D结构的方法不同,UniTS-Gen仅需反应前体的2D分子图指定的反应位点,即可从随机噪声出发,通过扩散去噪过程生成合理的3D过渡态构象。这一设计极大提升了实用性——在新反应探索中,产物结构往往未知,而2D图可通过SMILES或分子编辑工具轻松获取。

模型核心是自研的 高阶SE(3)等变图神经网络 HiEGNN。传统等变网络(如EGNN)虽能保证旋转和平移不变性,但在处理大分子时易出现“结构坍缩”——原子过度聚集导致不合理重叠。HiEGNN通过引入高阶张量表征,更精细地捕捉键角、二面角及远程几何耦合关系,有效维持复杂体系的空间完整性。

此外,团队提出 拓扑增强标量特征(TASFs) 机制,在去噪过程中持续注入2D图中的连接性、原子类型及反应位点信息。这确保生成结构既符合输入拓扑约束,又保留足够的构象自由度。例如,同一2D图可生成多个非对映异构过渡态,为立体选择性分析提供多样候选。

性能验证:在复杂体系中展现强大泛化能力

在UniTS-Lib测试集上,UniTS-Gen展现出显著优势。采用HiEGNN的版本将结构碰撞率(原子间距小于范德华半径之和的比例)控制在3.9%,而使用常规EGNN时高达66.4%;平均RMSD也从1.34 Å降至1.07 Å。这表明高阶等变表征对防止大分子结构坍缩至关重要。

更关键的是模型的分布外泛化能力。在三类OOS(Out-of-Sample)测试中——未见元素组合(Formula-OOS)、未见元素(Element-OOS)及超大分子(Maximum-OOS)——UniTS-Gen均表现稳健。尤其在包含403个全新反应的Formula-OOS集上,平均RMSD仅1.15 Å,碰撞率低至1.5%,接近同分布测试性能,证明模型学习的是通用化学规律而非数据记忆。

实际应用中,68.7%的生成结构可直接用于DFT优化并收敛至一阶鞍点;其中41.9%经内禀反应坐标(IRC)验证确为目标反应过渡态。典型案例包括:

  • 铁卟啉介导的氢原子转移:准确重建大环共轭结构与Fe–H距离;
  • 钌催化C–H活化:合理描述芳香环π配位几何;
  • 二十面体硼烷B–H活化:精确生成簇状骨架与反应中心键长。

所有案例均成功优化至正确过渡态,验证了模型在真实复杂体系中的可靠性。

推动反应机理研究从静态到动态的深化

UniTS-Gen的价值不仅限于结构生成,更在于赋能深层次机理探索。在竞争路径选择性研究中,团队对同一硼自由基体系分别指定C–H与C–F键活化位点,生成两类过渡态。DFT计算显示C–H路径能垒(36.0 kcal/mol)低于C–F路径(40.5 kcal/mol),与文献报道的选择性一致,证明模型可支持路径特异性分析。

立体化学复杂的[3+2]环加成反应中,UniTS-Gen从单一2D图采样出四种非对映过渡态构型,全部成功优化,且最低能垒构型对应主产物。相比传统依赖模板的手动搜索,生成式采样更可能覆盖关键构象空间。

更具突破性的是对双峰过渡态(post-transition state bifurcation)的处理。此类体系中,单一过渡态后分岔为两条产物路径,需结合分子动力学模拟才能完整描述。UniTS-Gen为一未见元素组合体系生成了正确双峰结构,后续准经典轨迹模拟成功复现[4+1]与[2+1]环加成产物的分支行为,展示了模型在动态效应研究中的潜力。

展望:迈向端到端自动化机理探索平台

UniTS框架的提出,标志着过渡态生成从“艺术”走向“工程”。作为上智院“燧人物质科学系列模型”的功能层,UniTS-Gen已集成至“Golab物质科学智能研发工厂”,并在“百题马拉松”直播中成功应对C–H活化等真实任务挑战。

未来方向包括:通过自动化文献挖掘持续扩展UniTS-Lib;融合机器学习势能面加速DFT优化;开发自动反应位点识别模块实现全链路无人干预。长远看,该技术有望嵌入自主化学实验平台,实现“输入分子→预测路径→验证机理”的闭环。

更重要的是,HiEGNN所展现的复杂3D结构生成能力,可迁移至催化剂设计、蛋白质-配体对接、晶体结构预测等领域。当AI不仅能“理解”化学,还能“创造”合理中间态时,我们离真正的智能分子科学又近了一步。