AI科研评测新基准:为何大模型在方法发现上仍难超越人类?

0 阅读

在过去的一年里,人工智能领域最引人注目的叙事莫过于“自进化”与“递归自我改进”。当大型语言模型能够熟练地进入代码仓库、调用复杂工具、修改训练脚本,并根据实验反馈进行迭代时,人们不禁开始畅想:AI是否已经具备了独立进行科学研究的能力?随着传统编程评测榜单逐渐趋于饱和,AI for Research(人工智能辅助科研)被广泛视为下一个能力前沿。然而,在这股热潮背后,一个更为本质且棘手的问题浮出水面:当前的AI究竟是在更高效地执行人类预设的工程任务,还是真正具备了像优秀人类研究者那样,发现推动学科发展的全新方法论的能力?

一张展示机器学习与人工智能多个研究领域(如时间序列、语言模型

要回答这个问题,首先必须厘清“自进化”叙事中混合的三种不同层级的能力。第一层是执行能力,即准确理解人类需求并将其转化为可运行的代码和实验流程;第二层是工程优化能力,即在固定目标下,通过调整超参数、替换组件或从大量候选方案中筛选出得分最高的组合;第三层则是方法发现能力,这是最高阶的形态,要求AI识别现有方法的根本局限,提出此前不存在的新机制,并证明该机制能够跨越不同的数据分布、任务类型和计算规模持续有效。

回顾机器学习的发展史,真正推动领域发生范式转移的,往往是第三类进步。卷积神经网络、残差连接、注意力机制、归一化技术以及扩散模型等基石性创新,其价值不仅仅体现在某一次特定评测分数的提升上,更在于它们具有极强的迁移性和扩展性。这些方法能够在更多数据和更大算力的支持下继续发挥作用,最终成为整个研究社区共享的基础设施。然而,现有的大多数评测体系并未真正触及这一核心能力。常见的数据挖掘型任务往往局限于固定数据集上的清洗与调优,适合衡量工程执行力,却无法判断一个算法改动是否具有普适性;而依赖快速评分器的组合优化任务,虽然可以通过大规模采样筛选候选,但与真实科研中耗时数天甚至数周的长周期实验存在巨大差异。

为了填补这一评测缺口,来自加州大学伯克利分校、清华大学、普林斯顿大学等多所顶尖高校的研究团队联合提出了MLS-Bench。这是一个覆盖12个机器学习方向、包含140个真实研究任务的综合性评测基准。与以往不同,MLS-Bench不仅要求模型提交可运行的方法,更强调在多个数据、环境、模型或规模上进行交叉检验。研究团队在同一代码库和训练流程中重新实现了至少三种强人类方法,包括领域公认的最优方案,以此作为基准来判断模型是否能在已知最佳实践的基础上实现真正的突破。

展示GPT-5.4、Claude Opus 4.6等模型Ag

主实验的结果令人深思:即便向模型提供了人类最强方法的完整实现代码,并允许其进行多轮实验迭代,当时评测的五个前沿模型所提出的方法,在整体表现上依然未能超过人类最强基线。进一步的提示消融实验和领域专家分析揭示了一个稳定的模式:模型主要擅长的是调优、工程优化以及对已有方法的重组,而真正具有原创性的新方法机制依然罕见。这表明,MLS-Bench的意义不仅在于增加了一张新的模型榜单,更在于它改变了我们测量AI科研能力的维度——从关注“代码能否运行”转向追问“提升是否源于算法本身的创新”以及“该方法是否具备跨场景的鲁棒性”。

展示多个大语言模型(如GPT-5.4、Claude Opus

在研究方法的设计上,MLS-Bench展现了极高的严谨性。每个任务都围绕一个明确的研究问题展开,要求模型改进特定的方法组件。例如,在研究优化器时,智能体被禁止修改模型结构;在研究训练目标时,不能绕过问题去替换数据或评分程序。这种严格的变量控制旨在隔离目标研究问题,排除通过扩大模型容量或增加训练数据等工程手段带来的分数虚高。研究团队通过逐行标注可修改代码范围,并在统一环境中复现强人类方法,反向校准了这些边界,确保评测既不会阻碍真正的创新,又能有效防止取巧行为。

此外,针对不同领域指标不可比的问题,MLS-Bench采用了三级聚合评分机制。以复现的人类基线结果为锚点,将最弱者映射为0,最强者映射为50,理论上限映射为100。这种相对评分方式消除了不同指标单位的影响,使得跨领域的性能比较成为可能。同时,考虑到真实训练的高昂成本,研究团队引入了经过校准的代理规模,确保在小规模实验中保持方法间相对优劣排序的一致性,从而在保证评测效度的同时降低了计算门槛。

深入分析研究结果,我们可以发现模型在“调优”与“发现”之间存在明显的性能断层。当提示词引导模型专注于优化和调试已有方法时,其表现显著提升;而当目标转向发现全新方法时,模型的表现反而下降。专家对提交代码的分析显示,模型倾向于从不同的强基线中抽取损失函数、网络模块和训练技巧进行重新组合。这种“拼凑式”创新虽然在局部可能带来收益,但缺乏对现有方法失败原因的深刻洞察,也无法形成指导新机制设计的理论假设。

另一个值得关注的现象是,增加迭代次数和大规模采样并不能自动突破性能上限。在验证成本较低的任务中,更多尝试确实能改善结果,但在复杂的深度学习任务中,收益很快饱和。更有趣的是,在开放部分测试反馈的实验中,进化搜索策略往往导致模型对可见目标的过拟合,从而损害了在保留条件上的泛化表现。这暴露出当前模型在平衡探索与利用、避免局部最优方面的局限性。

更深层次的瓶颈在于证据的建立与验证。科学发现不仅仅是提出一个方案,更包括判断哪些假设值得验证、设计能够区分不同解释的小实验,以及在有限预算下合理分配计算资源。在一项针对预训练环境的测试中,研究团队赋予模型灵活支配算力的权利,允许其自行选择代理模型大小、训练Token数和实验顺序。理论上,这种自由度应有助于模型通过低成本实验筛选高潜力方向。然而,实际结果显示,除个别情况外,拥有更多自由的模型表现反而下降。它们未能稳定地将算力分配给信息价值最高的实验,也无法根据中间结果灵活修正后续计划。

这一结果揭示了一个关键事实:当前模型缺少的不仅仅是知识储备,更是将知识转化为有洞见的假设、设计严谨实验并建立可信证据链的科学判断力。现有的自动发现范式,如AlphaGo、AlphaTensor和FunSearch,之所以成功,很大程度上依赖于验证过程的廉价、稳定和清晰。而在真实的机器学习研究中,验证往往是昂贵、缓慢且信息不完整的。系统无法依靠暴力搜索来解决问题,必须学会如何在不确定性中进行决策。

因此,AI科研的下一阶段核心挑战,可以概括为在验证难以规模化的条件下,实现可规模化的科学发现。这要求AI完成一个真正的研究闭环:从提出有洞见的假设开始,设计能够区分解释的实验,合理分配有限资源,根据不完整证据更新判断,并最终在跨数据和规模的验证中确立新方法的有效性。尽管MLS-Bench目前主要聚焦于机器学习方法发现,且面临计算成本高、静态榜单滞后等局限,但它为评估AI的科学能力提供了一个重要的起点。

未来,我们需要进一步拓展评测的维度,涵盖问题选择、假设质量、实验设计、证据判断以及研究沟通等全链条能力。更重要的是,研究范式需要摆脱对廉价验证器和大规模采样的依赖,探索如何在高成本验证环境下,通过代理实验、贝叶斯优化和主动学习等技术,提升AI的信息获取效率和决策质量。从“会运行研究流程”到“能像优秀人类科学家一样发现并验证新方法”,这段距离定义了Auto-Research和自进化AI下一阶段真正需要攻克的堡垒。只有跨越这一鸿沟,AI才能真正从工程助手转变为科学伙伴,推动人类知识边界的实质性拓展。