诺奖得主Doudna团队Science新突破:AI设计蛋白质超越自然演化极限

18 阅读

在生物技术与人工智能深度融合的今天,蛋白质设计的边界正在被迅速重塑。2025年7月17日,诺贝尔化学奖得主詹妮弗·杜德纳(Jennifer Doudna)及其团队在《Science》期刊上发表了一项具有里程碑意义的研究成果。他们成功利用人工智能算法,设计出了一种名为SynTnpB的新型基因编辑蛋白。令人惊叹的是,这种由算法“构思”出的蛋白质,其编辑活性在多种生物模型中不仅保留了功能,甚至在某些指标上超越了自然界演化了数百万年的天然酶。这一成果标志着“生成式生物学”正式从概念走向实证,为突破自然序列的局限提供了强有力的技术支撑。

包含基因编辑实验流程图(A)及多个基因敲除效率柱状图(B、C

突破自然演化的束缚:AI设计的逻辑重构

长期以来,基于CRISPR-Cas系统的基因编辑技术虽然已经实现了精准操作,但其核心酶蛋白大多源于自然界的发现与微调。尽管科学家可以通过定点突变来优化其性能,但要完全设计出自然界中不存在、且仍具备高效活性的新型RNA引导核酸酶,一直是一个巨大的挑战。现有的基于序列的生物语言模型,往往受限于训练数据中的天然序列分布,生成的变体通常只能接近天然序列,难以在大幅改写氨基酸序列的同时,保留原有的催化活性和结构稳定性。

杜德纳团队提出的新策略,巧妙地规避了这一瓶颈。他们并未单纯依赖序列预测,而是提出了一种“结构-进化”双重约束的AI蛋白设计框架。这一框架的核心在于,它不再将蛋白质视为线性的一维序列,而是将其还原为具有特定折叠模式的三维结构,并结合数百万年的进化信息进行约束。通过这种方式,AI可以在保留核心功能结构域的前提下,大胆地重新设计那些对序列变化相对耐受的区域,从而探索到天然序列空间之外的“非自然”领域。

在这一研究中,研究团队选择了小型RNA引导核酸酶TnpB作为设计对象。TnpB作为Cas9的前体或类似物,具有更小的分子量,更容易递送至细胞内,但其在真核细胞中的活性一直是不稳定的痛点。通过引入新的设计逻辑,团队旨在创造一种在多种细胞环境中均能高效工作的合成版本。

双重策略:从逆折叠到进化掩码的精妙组合

为了实现这一目标,研究团队构建了一个两阶段的设计与筛选流程,展现了算法与实验生物学紧密结合的力量。

首先,在序列生成模块,团队采用了ESM逆折叠模型(ESM-IF1)。与传统的从序列推导结构不同,逆折叠模型是根据已知的蛋白质三维结构,反向推导出可能形成该结构的氨基酸序列。团队将TnpB的三维结构作为输入,让AI生成大量的候选序列。这些序列在宏观上保留了TnpB的整体折叠模式以及RuvC结构域中至关重要的DED催化三联体,确保了基本的催化潜力。然而,初始生成的序列往往会突变掉参与RNA或DNA识别的关键残基,导致功能丧失。

展示ESM-IF1生成TnpB蛋白结构、催化位点、RNA/D

为了解决这一问题,团队引入了基于进化信息的序列掩码策略。他们分析了TnpB及其同源蛋白的进化数据库,计算每个位置残基的位置保守性(Ci)以及与核酸序列的共同进化耦合强度(σi)。设定阈值后,那些对功能至关重要的保守位点和高耦合位点被“锁定”为野生型序列,而其余位置则完全交给ESM-IF1进行自由设计。这种“部分固定、部分自由”的策略,既保护了核心功能,又释放了巨大的序列设计空间。

其次,在筛选模块,团队采用了高效的细菌ccdB毒素系统进行高通量筛选。这是一个巧妙的正筛选系统:只有当TnpB变体具备切割活性时,细菌才能存活。初步筛选发现,仅使用位置保守性约束的全长设计,其活性提升有限。团队深入分析后发现,TnpB的两个主要结构域——负责DNA识别的REC结构域和负责RNA结合与催化的NUC结构域——对序列变化的耐受度截然不同。REC结构域对替换极为敏感,而NUC结构域则表现出惊人的可塑性。

基于这一洞察,团队优化了筛选策略,采用Ci和σi的双条件约束组合,专门针对REC-NUC的组合进行设计。在筛选出的1980个组合中,最终鉴定出9个具有极高活性和多样性的SynTnpB变体。这一步骤证明了理解结构域特异性对于AI蛋白质设计的重要性。

活性超越天然:多维度的实验验证

设计出来的蛋白质是否真的有用?研究团队在人类细胞、植物细胞以及生化实验中给出了肯定的答案。

在人类细胞(HEK293T)中,筛选出的变体v1和v5表现尤为突出。实验数据显示,v5的编辑效率达到了50%,约为野生型TnpB的1.8倍。在植物模型拟南芥原生质体中,v1变体在多个测试靶点上均优于野生型。这种活性的显著提升,直接证明了AI设计策略的有效性——非自然的序列组合确实可以带来更优的功能性能。

包含分子机制示意图、实验数据图表(柱状图、散点图、热图)及实

除了活性,特异性是基因编辑工具另一大关键指标。全基因组Tn5标签化分析显示,v1变体的特异性与野生型相当,确保了编辑的精准度;而v5和v7虽然活性较高,但也检测到更多的脱靶位点。这表明,AI设计的变体在“效率”与“精度”之间可能存在新的权衡,为后续优化提供了方向。

进一步的Western blot和热稳定性测试排除了表达水平差异对活性的影响,证实了活性提升源于蛋白内在性质的改变。v7变体虽然切割反应速度略慢于野生型,但其热稳定性相当,且保留了较强的靶链切割能力,显示出独特的动力学特征。

冷冻电镜揭秘:AI如何重塑分子界面

为了让外界信服AI设计并非“黑箱”操作,研究团队对序列分化程度最高的v7变体进行了高分辨率的冷冻电镜结构解析,分辨率达到2.8 Å。这是首次通过实验确定AI设计的RNA引导核酸酶的原子结构,其意义不言而喻。

结构分析揭示了令人兴奋的细节:AI生成的残基在多个结构域中与RNA-DNA界面形成了新的稳定相互作用。这些新接触点在野生型中并不存在,它们像“铆钉”一样,稳定了蛋白质在不同构象状态下的界面,这可能是其活性增强的结构基础。

更有趣的是,团队捕获到了此前在TnpB中从未报道过的“TAM结合构象中间体”。在这一状态下,AI生成的N4R残基与保守的“磷酸锁”残基K84协同作用,稳定了DNA异源双链种子区的单碱基配对。此外,在R-loop形成状态下,AI生成的残基分布在REC、NUC和lid等多个区域,与RNA-DNA双链形成广泛接触,同时保留了有助于双链形成的桥接螺旋弯折运动。

展示蛋白质与核酸分子结构及相互作用机制的科学示意图,包含TA

这些结构细节不仅解释了SynTnpB的高活性来源,也为理解RNA引导核酸酶的工作机制提供了全新的视角。AI生成的氨基酸并非随意排列,而是通过精细的空间相互作用,优化了底物结合和催化过程。

局限性与未来展望:从TnpB到更广阔的生物世界

尽管成果斐然,研究团队也冷静地指出了当前方法的局限性。首先,模块化设计原则的普适性仍有待验证。TnpB的REC和NUC结构域对序列变化的不同耐受性,可能并不适用于所有多结构域蛋白。对于其他复杂的核酸结合蛋白,如何确定哪些部分可以“自由设计”,哪些部分必须“严格保守”,仍需更深入的研究。

其次,数据依赖性是一个硬性约束。目前的序列掩码策略高度依赖进化数据库中序列的多样性和代表性。如果目标蛋白的进化信息稀缺,或者序列多样性不足,AI设计的成功率将大幅下降。因此,构建更丰富、更均衡的蛋白-核酸配对数据库,是将这一方法推广到其他领域的先决条件。

最后,机制理解的深度仍需加强。AI生成的残基如何动态地影响核酸结合和构象变化,目前仍主要依赖静态结构的推断。未来的研究需要结合时间分辨的生化实验和分子动力学模拟,进一步揭示这些“非自然”残基在动态过程中的作用机制。

结语与启示:生成式生物学的新时代

杜德纳团队的这项研究,不仅仅是一次技术上的成功,更是范式转换的信号。它表明,通过结合生成式AI算法与传统的结构生物学、进化生物学,人类可以不再仅仅局限于“发现”自然界现成的蛋白质,而是能够“创造”自然界尚未存在但功能更优的生物分子。

这种“超越自然演化”的设计能力,意味着基因编辑工具库将迎来爆发式增长。未来,我们可能会看到一系列针对特定细胞环境、具有超高精度、超低脱靶率、且易于递送的定制化核酸酶被设计出来。这将为遗传病治疗、农作物改良以及基础生物学研究提供前所未有的工具。

当然,技术的进步也伴随着伦理与安全的考量。当AI能够设计出自然界不存在的活性蛋白时,生物安全边界的管理也需同步升级。但不可否认的是,我们正站在一个新时代的门槛上,在这个时代,生命的代码不仅可以被阅读,更可以被重新编写和创造。随着算法的迭代和数据积累的增多,生成式生物学有望成为生物制造和精准医疗的核心驱动力,开启一个由AI驱动的生命科学新纪元。

对于科研工作者而言,这项研究提供了一个清晰的启示:未来的创新将不再孤立地依赖生物学实验或计算机科学,而是源于两者的深度交叉。理解蛋白质的结构-功能关系,结合大规模数据驱动的设计方法,将是解开生命复杂密码的关键钥匙。杜德纳团队的SynTnpB,只是这把钥匙开启的第一扇大门,门后的世界,充满了无限可能。

学术论文标题页截图,展示文章标题及作者列表,属于正文内容相关