Anew Labs 首轮融资后亮出技术底牌:结构预测、湿实验闭环与垂直大模型

9 阅读

通用与垂直正在靠近

最近几个月,AI 制药领域出现了两条明显靠拢的路径:一边是 Anthropic 这样的通用大模型公司开始组织生物实验,另一边是 Isomorphic Labs 这类专注生物分子建模的团队开始招聘大模型人才。

图片

今年 6 月,Anthropic 推出 Claude Science,把科研工具、计算资源和大模型整合进同一个工作环境。它随后展示了 Claude 调用专业模型设计蛋白结合分子,并交由外部实验室验证的结果——大模型的角色正从“助手”转向能组织研究任务的 Agent。

图片

几乎同时,Alphabet 旗下的 Isomorphic Labs 宣布完成 21 亿美元 B 轮融资。这家公司由 AlphaFold 背后的 Demis Hassabis 领导,目标是用 AI 重构药物研发流程。近日,它挂出了 LLM 相关岗位,明确要“在前沿模型上大规模实施和优化 LLM 后训练方法”。

图片

就在这个节点,一个过去五年鲜少公开发声的团队——Anew Labs——也把布局摆到了台前。他们刚完成分拆后的首轮融资,金额达 2.9 亿美元,投资方包括红杉中国、高瓴、IDG 等头部机构。紧接着,官网悄悄上线了名为 AnewDDE 的技术报告,集中展示了结构预测、亲和力评估、抗体湿实验闭环设计,以及千亿参数大模型 AnewMind。

图片

这使得 Anew 值得与 Anthropic、Isomorphic 放在一起观察。三家起点不同,却都在尝试连接领域专业模型、大模型与实验反馈。Anew 展示的,正是自己在这几个环节上已经做到哪一步。

结构预测略优于 IsoDDE,但关键在后续转化

AnewFold 的核心结果,先看两组数字:在 FoldBench 抗体-抗原结构预测任务上,成功率为 76.2%,而 Isomorphic 公布的 IsoDDE 为 75.6%;在蛋白-配体任务上,两者分别为 77.4% 和 76.0%。这些任务回答的是:给定参与相互作用的分子,模型能否准确预测它们以什么位置和形状结合。

报告还测试了更复杂的分子胶三元体系。在 131 个共同案例中,AnewFold 同时预测蛋白界面与配体位置的联合成功率达到 71.8%,高于几个开源基线。

这些数据足以让 Anew 进入最前沿生物分子模型的讨论圈。但必须承认,小幅分差不足以证明明确领先,评测设置是否完全对齐也存疑。更有意义的判断是:Anew 已展示出接近前沿的结构预测能力,接下来要看它如何转化为实际的研发收益。

毕竟,模型性能会被持续追赶。长期价值不只取决于预测准不准,更在于:候选分子怎么选、预测失败如何识别、实验结果如何反馈到下一轮优化。为此,AnewDDE 不只包含 AnewFold,还有亲和力评估工具 AnewAffinity、设计流程 AnewDesign,以及面向研发推理的 AnewMind。它们分别服务于结合强弱评估、候选设计和证据分析。

这套模块化布局是加分项,但模块之间是否产生协同效应,还得看具体任务中的表现。

纳米抗体 vs. protein minibinder:实验目标不同,不能只比命中率

AnewDDE 报告了一项针对内部靶点的纳米抗体(VHH)设计实验。Agent 先检索文献与结构数据库,分析结合位点,再组织生成和筛选。第一轮从 3092 个初筛候选中推荐 50 条序列进入湿实验,最终得到 7 个 KD 低于 400 nM 的克隆。

实验结果随后用于亲和力优化。第二轮测试 100 个候选,获得 16 个个位数纳摩尔 KD 的克隆。KD 越低,通常意味着结合越强,而纳摩尔级别的 KD 是产业界对治疗性抗体的基本要求。两轮共测试 150 个克隆,强结合抗体占比为 10.7%。

熟悉 Anthropic 动态的人可能会问:Claude 的蛋白设计命中率不是更高吗?确实。Anthropic 8 月公布的实验中,在不同设置下实现了约 22%—35% 的结合命中率,后续又报告跨 12 个靶点接近 50% 的成功率。

但这两组数字不能直接比较。

关键区别在于:Anthropic 设计的是 protein minibinder,而 Anew 做的是纳米抗体。

两者都属于 binder,但所处的研发语境完全不同。Anthropic 自己也在报告中明确指出,protein minibinder 尚非标准治疗药物形式,现阶段主要用于机制研究或靶点验证,真正进入临床的案例极少。相比之下,抗体是高度成熟的药物平台,其设计不仅受特定骨架和 CDR 区域约束,还需兼顾亲和力、稳定性、可开发性等更贴近成药的实际问题。

因此,“测到结合”和“达到个位数纳摩尔亲和力”本身就是不同门槛。靶点难度、实验迭代轮次、验证标准都会显著影响结果。更准确地说,Claude 展示的是通用 Agent 参与蛋白设计的学术探索能力,而 Anew 的工作更贴近工业级候选药物开发的要求。

Anthropic 证明了通用模型能调用垂直工具、在多个靶点上组织设计;Anew 则展示了从初始命中到实验反馈优化的完整闭环。后者目前基于单个内部靶点,跨靶点验证和功能评估仍需补充,但两轮设计带来亲和力提升,是有价值的执行证据。

这也引出一个核心问题:当通用模型越来越擅长调用工具,垂直公司的优势在哪里?

Anew 的潜在优势,是同时掌握专业模型、实验流程和项目经验。能否靠这些能力提高每轮实验的产出效率,比一次性的命中率更值得跟踪。

垂直大模型的价值不在参数规模,而在反馈飞轮

AnewMind Preview 是报告中最吸引 AI 从业者关注的部分。Anew 在具有推理能力的大模型底座上,进行了千亿参数规模的全参数后训练,目标是增强模型对研发证据和决策约束的理解。

报告显示,AnewMind 在四组 ADMET 与药物性质评测中均进入参评 LLM 前五,其中环肽渗透性排名第一、抗体可开发性排名第二。在 PharmBench 上,总分位列 17 个模型第三,分子设计与合成分项排名第一。

领域训练确实可能带来特定任务收益。但千亿参数和全参数后训练本身并不构成产品护城河。药企完全可以直接使用最强的通用模型,为什么还要用 AnewMind?

Anew 自己的评测也承认,通用模型在不少研发任务上表现强劲,AnewMind 并未全面领先。报告缺少完整的基座对照和训练消融实验,外界难以判断各项提升究竟来自数据、训练方法,还是架构调整。

因此,更合理的期待是:AnewMind 能否在具体研发环境中形成持续优势? 比如支持私有部署、处理敏感数据、无缝对接内部专业工具,更重要的是——能否用新的湿实验反馈形成“研发-训练”飞轮,持续提升模型能力。

垂直模型的机会,恰恰在于能持续获得通用模型接触不到的真实研发反馈,并将其转化为可重复的能力提升。Anew 同时拥有算法团队、实验平台和自有管线,具备探索这条路径的条件。但实验数据不会自动变成优质训练数据:失败原因如何标注、不同实验如何对齐、模型建议是否真的改善了结果,都需要大量额外工作。

后训练只是起点,研发与训练之间的反馈能否持续运转,才是长期竞争力的来源。

PharmBench:考的不是知识,而是研发判断

PharmBench 是 AnewDDE 中容易被忽略但极具价值的部分。它包含 50 个研发场景、200 道问题,由制药专家结合真实项目决策和实验结果设计。

这里考的不再是教科书知识,而是多年制药实践中沉淀下来的隐性经验:知道哪些数据可信、结论能推多远,以及什么时候必须对一个“漂亮结果”保持怀疑。

例如,一道题描述:修改化合物后,选择性提高了,但靶点活性却下降了。模型需要判断:这种变化是因为对目标蛋白结合更强,还是对脱靶蛋白结合更弱?不同解释会导向完全不同的下一轮设计方向。

另一道题中,抗体亲和力已经很强,却容易失稳和聚集;而负责识别抗原的关键区域又不能改动。模型需要在极有限的空间内,提出合理的分析思路和实验方案。

这比回答知识点更接近真实研发判断。PharmBench 还采用逐步披露信息的方式,观察模型能否随着新证据出现修正自己的回答。

但必须指出:连续回答研发问题,与自主推进研发仍有距离。

如果后续实验信息由预设流程提供,模型展示的主要是证据理解与决策建议能力。它尚未证明自己能主动选择最有效的实验、承担预算约束,或从失败中开辟新路径。

此外,内部评测还有一个待解问题:评分是在衡量科学推理能力,还是在奖励与历史项目路径相似的答案?真实研发常有多条合理路线,未被采用的方案未必错误。

这些问题决定了 PharmBench 榜单应如何解读。总分第三是积极信号,但完整的评分规则、独立专家复核和外部测试,会让它更有公信力。

对 Anew 而言,提出这套评测体系本身也体现了方向:把制药专家的判断转化成可测试、可改进的任务。如果未来开放评测方法,PharmBench 的价值可能超出 AnewMind 自身的成绩单。

三条路线交汇,竞争焦点正在转移

Anthropic、Isomorphic 和 Anew 的共同动作,让 AI 制药的竞争逻辑变得更清晰。

通用模型公司需要专业工具和实验反馈来证明实际价值;生物分子模型公司需要推理与任务组织能力来突破单一预测瓶颈;而拥有自有管线的团队,则能持续获得具体研发目标和现实约束,形成闭环。

相似的布局不等于相同的能力水平。模型精度、实验广度、数据积累与管线进展,仍需分别评估。

Anew 这次亮相的意义,在于提供了足够具体的材料,让外界可以开始认真评估它:结构预测接近前沿,说明专业模型已有积累;领域后训练和 PharmBench,展示了对研发推理的投入;两轮纳米抗体实验,则让设计、测量与优化之间的连接有了实例。

融资让它获得了关注,AnewDDE 让这份关注有了技术依据。下一次最有说服力的更新,将来自更多靶点的验证、更完整的实验记录,以及模型真正帮助管线向前推进的具体结果。