无界进化开放 Karl Workbench 内测,科研 AI Agent 首次跑通完整假说验证闭环
Karl Workbench 开放内测:让 AI 真正跑通一次完整的科研任务
9 月 16 日,无界进化(INFevo)正式开放其科研 AI Agent 工作台 Karl Workbench 的 Beta 内测。这不是又一个能写代码或总结文献的大模型插件,而是一个试图把整个科研流程——从假说提出、数据分析到证据沉淀——打包进一个可追溯、可复现、可迭代的工作空间。

在开放前,Karl Workbench 已在耶鲁大学、Broad 研究所等机构联合发布的科研 Agent 评测基准 SciAgentArena 上完成复测。结果很硬:在单细胞组学任务中,综合得分 0.86,超过 Hermes、STELLA(mem)、Codex、Claude Code、Biomni,也高于人类专家参考解的 0.80;在更复杂的空间组学任务中,得分为 0.70,与人类专家持平,稳居所有 AI 系统第一。

关键不只在分数。Karl Workbench 在两项评测中的数据分析通过率均为 1.00,意味着它成功跑通了全部预处理和分析步骤。尤其在空间组学中,它是全场唯一通过所有预处理环节的 AI 系统。要知道,这次复测中多个系统使用了相同的底层大模型(如 DeepSeek V4 Pro 或 Claude Opus 5),但 Karl Workbench 依然拉开差距——这说明,决定科研 AI 能力上限的,早已不是底座模型本身,而是系统如何组织上下文、调用工具、验证逻辑并管理研究状态。

科研不是问答,是连贯的任务链

传统大模型擅长回答孤立问题:“怎么用 Seurat 做聚类?”、“这段代码报错怎么改?”但真实的组学研究远不止于此。你得先读取原始数据,检查质量,选择合适的方法,运行代码,解读结果,再根据中间发现调整策略。任何一个环节断掉,结论就不可靠。

SciAgentArena 正是针对这一点设计的。它不考单点问答,而是直接给 AI 一个接近真实场景的复杂任务,比如“分析这份空间转录组数据,找出肿瘤微环境中免疫细胞的空间分布模式”,然后对每一步——数据加载、质控、标准化、聚类、注释、可视化——进行逐项核验。这种“逐步验证(Step-wise Verification)”机制,逼着系统必须像人类研究员一样,保持逻辑连贯。
Karl Workbench 能在这种压力下拿第一,靠的不是更强的语言能力,而是一套专门为此设计的架构。它把研究意图、假说、数据、文献、工具和中间证据统一放进同一个工作空间,并全程记录执行轨迹。任务结束时,你不仅拿到结论,还能一键导出完整脚本,在其他环境重新运行——这才是可复现科研该有的样子。
RSD 框架:让 AI 从自己的错误里学习
大模型有个致命弱点:每次调用都是“失忆”的。今天试错的方法,明天可能又重来一遍。更糟的是,面对高维、高噪声的生物数据,模型容易跳过关键步骤,或者凭空编造不存在的结果(即“幻觉”)。
Karl Workbench 的核心突破,是引入了无界进化自研的 递归科学发现(Recursive Scientific Discovery, RSD)框架。这个名字听着玄,其实目标很实在:让科学发现过程能从自身历史中学习。
RSD 把整个研究拆成五层能力:
- 记录层:保存任务输入、数据版本、代码和参数,做到全链路可追溯;
- 积累层:自动记下哪些假说被证伪、哪些路径行不通,把这些“失败”变成后续任务的约束条件;
- 产物层:把关键结果封装成独立的研究产物,严格绑定底层数据和证据链;
- 监督层:内置审查机制,检查分析逻辑是否自洽,同时保留人类科学家的最终决策权;
- 进化层:识别系统在不同任务中的强弱项,动态优化后续的任务规划策略。
这五层不是割裂的功能模块,而是一个闭环:记录形成历史,历史转化为可复用的产物,产物带入新任务,监督确保质量,进化则让系统越用越聪明。
假说不再是脑内一闪念,而是可管理的研究资产
过去,科学假说要么写在论文里,要么记在笔记本上,要么只存在于研究者的记忆中。一旦换人、换项目,这些线索很容易丢失。
Karl Workbench 首次把“科学假说”本身变成了可操作的研究资产。在 The Popper Project(TPP)平台中,你可以创建一个假说,比如“X 基因的表达水平与肿瘤浸润 T 细胞的空间聚集正相关”。这个假说会被结构化存储,附带来源文献、初步证据和待验证的问题。
当你启动一个新任务时,可以直接把这个假说“拉”进来,配上你的数据集,让系统自动规划验证路径。任务结束后,新证据会反过来更新假说的状态——支持、部分支持,还是被推翻。于是,研究流程变成了清晰的闭环:
假说 + 研究目标 + 数据 → 分析代码 → 提取证据 → 更新假说
假说不再是一次性消耗品,而成了可以持续积累、迭代、复用的知识单元。这正是 Karl Popper 科学哲学的核心:知识通过不断证伪而进步。无界进化用技术手段,把这一理念落到了工程层面。
双引擎驱动:OCOO-T 预测 + Karl 执行
Karl Workbench 并非孤立存在。它与无界进化此前发布的虚拟细胞大模型 OCOO-T 共同构成技术双引擎。
OCOO-T 是个能预测细胞对药物、基因扰动响应的模型,在 Tahoe100M、Replogle 和 PBMC 三大公开基准上均达到 SOTA。这意味着,研究人员可以在实验前,先用 OCOO-T 在超大规模候选空间中做计算筛选,快速锁定高潜力靶点或干预策略。
而 Karl Workbench 则负责把这类预测结果落地:导入真实数据,设计验证实验,执行分析流程,沉淀证据链。两者结合,大幅缩短了“假说—验证”的周期。
未来,这套系统还能对接自动化实验平台。AI 提出假说,模型预测结果,机器人执行湿实验,数据回流更新模型——一条从计算到实验再到认知更新的闭环正在成型。
科研基础设施的时代来了
Karl Workbench 的开放,标志着 AI for Science 正在跨越一个关键门槛:从“辅助工具”走向“科研基础设施”。
过去几年,我们见过太多“AI 写代码”“AI 读论文”的演示,但它们大多停留在单点效率提升。而真正的科研瓶颈,从来不是写不出一段 Seurat 脚本,而是如何在海量可能性中不迷失方向,如何避免重复踩坑,如何让每一次尝试都为下一次铺路。
Karl Workbench 试图解决的,正是这些系统性问题。它不承诺取代科学家,而是帮科学家更好地管理复杂性、积累认知复利。在这个意义上,它更像是一个“研究操作系统”——底层跑的是数据和代码,上层承载的是假说、证据和科学判断。
Beta 版现已开放申请,访问 https://thepopperproject.com/ 即可体验。对于那些每天和单细胞、空间组学数据打交道的实验室来说,这或许是最接近“科研自动驾驶”的一次尝试。