AI精准编辑新突破:ContactSeek如何利用AlphaFold3提升基因编辑特异性
在生物化学转化中,实现高特异性对于研究和治疗都至关重要。尤其是对于基因组编辑,提高工具的特异性可确保有效且精确的编辑效果。为实现这一目标,人们采用了理性设计和定向进化策略。然而,结构引导的理性设计依赖于经验性的人工专业知识,成功率低,且常受制于活性与特异性之间的权衡。定向进化则需要复杂的回路设计和平台实现,并且可能陷入局部最优解。
最近,来自北京大学、华东师范大学等的研究团队提出了一种专为特异性改进而设计的AI框架——ContactSeek,利用AlphaFold3(AF3)预测的接触概率(CP)来提高基因组编辑器的特异性。研究论文以《Precise DNA base editing using AlphaFold3-based contact modelling》为题发表于《Nature》。

基于CP的ContactSeek
由于蛋白质语言模型和逆折叠模型是为蛋白质设计的,它们无法捕捉蛋白-DNA-RNA复合物中的构象差异,因此无法学习特异性的决定因素。研究团队发现接触概率(CP)是一个被低估的AF3输出,CP可以被用来灵敏地测量生物分子间的相互作用。因此,他们尝试设计一个基于CP的框架,即ContactSeek,来识别差异相互作用。

首先,研究团队提取了Cas蛋白与sgRNA/tsDNA/ntsDNA之间的CP;其次,他们通过将脱靶三元复合物与其靶向对应物进行比较来计算ΔCP,并利用这些值来识别Cas蛋白上残基与DNA或sgRNA相互作用的接触区域;第三,基于CP、ΔCP和源自测序的脱靶信号对接触区域的重要性进行排序。
ContactSeek利用AF3预测的CP来模拟全基因组范围的脱靶相互作用,从而揭示特异性决定残基并实现精确的DNA碱基编辑。ContactSeek的输出包括共有接触区域(CCRs)的排名,以及这些CCRs内的关键接触残基。CCRs可代表蛋白质–DNA–RNA相互作用的空间关联区域,并包含对特异性提升具有功能重要性的残基。
在应用ContactSeek时,该研究独立地模拟了核心Cas–DNA–RNA复合物和二元脱氨酶–RNA复合物,而非依赖于全长复合物,这使其能够规避全长复合物预测中组件定位错误所带来的影响。

实验评估
实验验证表明,ContactSeek的成功率约为56.5%(13/23)。并且,通过扩展至TadA8e脱氨酶,ContactSeek取得了约64.7%的成功率,并大幅减少了RNA脱靶编辑和不依赖sgRNA的DNA脱靶编辑。这些结果凸显了ContactSeek应对不同类型脱靶效应的能力。
研究团队将ContactSeek应用于TadA8e,多项正交检测表明,其最佳变体Cas9 (K1020D)–TadA8e (F156D)相较于文献中几种基于高保真Cas9的ABEs,表现出更优越的整体特异性。此外,ContactSeek还可推广至基于Cas12a的胞嘧啶碱基编辑器。
应用前景与挑战
ContactSeek通过整合结构维度和功能维度,提高了基因组编辑工具的精度。研究团队预期,通过与匹配的特异性测量(例如基于测序的检测)相结合,ContactSeek将广泛适用于多种DNA和RNA编辑工具。
然而,ContactSeek的应用也面临一些挑战。首先,AF3预测的准确性依赖于输入复合物的结构信息,对于某些复杂的编辑系统,可能需要优化建模策略。其次,ContactSeek目前主要针对碱基编辑器,对于其他类型的编辑器(如Prime Editor)的适用性仍需进一步验证。此外,计算资源的需求较高,可能限制其在资源有限实验室中的普及。
尽管如此,ContactSeek的提出标志着AI在基因编辑领域的又一重要进展。它不仅提高了编辑的特异性,还为理解蛋白质-核酸相互作用的分子机制提供了新视角。未来,随着AF3等预测工具的不断改进,ContactSeek有望成为基因编辑工具设计的标准流程之一。
结论
ContactSeek作为一种基于AlphaFold3接触概率的AI框架,成功提升了基因组编辑器的特异性。通过模拟脱靶相互作用并识别关键残基,它在多种碱基编辑器中展现了高成功率,并显著减少了脱靶效应。这一方法不仅为基因编辑工具的设计提供了新思路,也为精准医疗和基因治疗的发展奠定了基础。随着技术的进一步优化,ContactSeek有望在更广泛的生物医学应用中发挥重要作用。