中国版生物DeepSeek崛起:四牛津学霸如何用AI重构生命科学范式
在人工智能重塑千行百业的浪潮中,通用大模型的竞争已趋白热化,而垂直领域的深度应用正成为新的技术高地。当DeepSeek-V4-Flash以算法创新震撼全球通用大模型圈时,中国生命科学领域也迎来了一位重量级选手。由四位牛津大学归国学者创办的津渡生科,自主研发了全球首个基于原始预训练的多组学大模型GeneLLM。这一突破不仅填补了中国在生命科学基础大模型领域的空白,更被业界视为“中国版生物DeepSeek”,标志着AI对生命科学的理解从单一结构预测迈向了系统级认知的全新阶段。
传统生物信息学分析长期依赖基因注释、序列比对和人工定义标签。这种范式虽然严谨,但本质上是一种“后验”逻辑,即先由人类专家划定认知边界,再由模型在限定范围内寻找规律。这种方式极易丢失隐藏在海量原始数据中的未知生物信号,且难以应对复杂疾病的多维度特征。GeneLLM的核心创新在于彻底摒弃了预处理的人工干预,直接以RNA组、蛋白质组、代谢组等多组学的原始测序数据作为训练基石。它将约150bp长度的RNA测序片段,通过7个碱基组成的滑动窗口切分为生命Token,利用Transformer架构在无监督状态下预测下一个碱基。这种机制让AI像学习自然语言一样,直接从生命的原始信号中自主发现规律,实现了从“读字典”到“懂语言”的本质跨越。
在算力效率与模型性能之间,津渡生科找到了一条极具性价比的路径。不同于硅谷巨头依靠数万张H100显卡堆砌万亿参数的暴力美学,GeneLLM通过算法优化实现了“四两拨千斤”。目前,该模型已完成15亿参数和3.5万亿碱基序列的预训练,XLarge版本更是达到了300亿参数。更为关键的是其在实际应用场景中的表现:在传统方法需要6Gb深度测序才能保证准确性的情况下,GeneLLM仅需1Gb极浅深度测序即可保持AUC大于0.8的高准确率,成本缩减高达83%。这一突破使得普惠精准医疗从概念走向现实成为可能,为大规模人群筛查和早期疾病识别提供了坚实的技术支撑。
然而,仅拥有强大的认知模型并不足以构成完整的AI for Science闭环。正如前OpenAI后训练负责人Liam Fedus所言,互联网上的文本和代码资源终将耗尽,科学发现的下一步必须依赖实验迭代。当前,大多数实验室仍是为人类设计的,仪器协议各异、操作依赖人工经验,形成了AI进入物理世界的巨大壁垒。津渡生科深刻洞察到这一痛点,推出了BioFord Harness智能实验执行系统,旨在解决AI落地的“最后一公里”问题。这套系统并非简单的机械臂替代人手,而是将实验室转化为一个可编译、可调度、可观测、可追溯的智能系统。
BioFord Harness通过通用仪器抽象层,打破了PCR仪、酶标仪、流式细胞仪等异构设备之间的协议壁垒。它能够将科学意图或实验DSL编译为设备可执行的指令,并在多设备间进行动态调度与资源管理。更重要的是,它建立了实验结果、设备日志和环境参数的回流机制,使每一次实验数据都能成为下一轮模型优化的输入。这种设计构建了一个持续进化的数据飞轮:科学问题触发AI理解,生成实验方案,调度设备执行,数据回流优化模型,进而开启新一轮探索。在此过程中,即便是失败的实验数据也被赋予了极高价值,参数选择的逻辑、环境条件的偏差、错误路径的证明,全部沉淀为系统的“经验”,避免了传统实验室中因人员流动导致的知识流失。
在认知层,BioFord Agent由文献检索、实验设计、科学智能、实验调度和数据分析五大智能体组成协同网络。以实验设计为例,传统科研团队往往需要数月时间才能完成的方案制定,在智能体的辅助下可缩短至一周。文献检索智能体能快速梳理海量学术成果,辅助提出假设;实验调度智能体则自动排程并规避冲突,形成可追溯的审计链条。这种全流程的自动化与智能化,不仅数倍提高了科研效率,更将科学家从繁琐重复的操作中解放出来,使其能专注于更具创造性的科学思考。
津渡生科的创始团队背景为其技术路线提供了深厚支撑。CEO金泳成及其三位合伙人分别具备生物工程、计算机科学、计算生物学和商业运营背景,其中计算机学院副研究员沙磊更是小米大模型负责人罗福莉的同门师兄。这种高度互补的学科交叉背景,使得团队既能深入理解生物学的复杂性,又能驾驭前沿的AI技术。公司命名“津渡”,寓意从牛津学术高地出发,渡人抵达AI for Science的终点。尽管创业初期面临投资方对“AI+生物”模式的不解,但随着国家《关于深入实施“人工智能+”行动的意见》的发布,赛道迅速升温。津渡生科在一年内完成四轮融资,获红杉中国种子基金、高特佳投资等一线机构重注,验证了其商业模式的可行性。

纵观全球AI for BioScience地图,主要玩家可分为三类:一是如Biomni和FutureHouse般的数字端AI科学家,局限于虚拟世界;二是如晶泰科技和Lila Sciences般的全栈自主路线,依赖重资产投入;三是如英矽智能般的端到端管线路线,风险集中于单一药物研发。津渡生科选择了第四条路:专注构建物理Harness,做模型与实体实验系统之间的轻量化基础设施。这种策略避免了与巨头的算力军备竞赛,也不承担新药研发的高昂风险,而是通过接管客户已有实验室,提供可订阅、可扩张的“算力+实验”服务。
这种轻量化的打法构建了独特的护城河。算力可以购买,模型可以开源,但跨实验室的执行网络、设备接口标准以及积累的失败实验数据却是无法复制的资产。随着接入实验室数量的增加,BioFord系统将掌握更多维度的真实世界数据,进一步反哺GeneLLM模型,形成强者愈强的马太效应。金泳成指出,AI for Science的分水岭不在于模型回答得像不像科学家,而在于实验室能否成为一个持续学习的系统。
从牛津实验室到深圳创业基地,从无人问津到资本追捧,津渡生科的历程折射出中国硬科技创业的坚韧与智慧。他们不仅在技术上实现了从结构预测到系统理解的跃迁,更在商业模式上探索出了一条可持续的产业化路径。当AI开始“通宵”科研,科学发现不再仅仅依赖天才的偶然灵感,而逐渐转变为可预期、可计算的必然过程。这不仅是技术的进步,更是科研范式的根本性变革。未来,随着更多实验室接入这一智能操作系统,生命科学的探索边界将被极大拓展,人类对生命奥秘的理解也将进入一个前所未有的加速时代。