AI研究员已上岗:OpenAI内部3倍AI劳动力如何重塑科研范式?

0 阅读

近年来,人工智能领域最引人注目的趋势之一,是AI开始参与自身进化的过程。这一现象被称作“递归自我改进”(recursive self-improvement),被视为通向通用人工智能(AGI)的关键路径。然而,这种能力究竟发展到了何种程度?是停留在理论构想,还是已悄然嵌入顶级实验室的日常运作?

图片

2026年8月,OpenAI发布了一篇极具分量的内部报告,首次系统性地公开了AI在其研究流程中的实际应用规模与影响。数据显示,截至该时间点,OpenAI研究部门中,每1个人类工作日对应约3.1个AI Agent工作日。这意味着,在工作时长维度上,AI已成为研究团队中规模三倍于人类的“第二劳动力”。

图片

这一数字并非凭空而来。回溯至2026年初,大多数研究员对AI Agent的使用仍较为谨慎。但到8月中旬,中位数研究员每日消耗的推理token按API价格折算已高达600美元;而处于第90百分位的重度用户,日均成本甚至突破7000美元。更关键的是,自2026年6月起,AI Agent的总运行时长正式超过人类研究人员的总劳动时长,标志着自动化科研进入实质性扩张阶段。

图片

值得注意的是,这些Agent并非仅执行简单的代码补全任务。它们已深度介入科研链条的多个环节——从搭建实验基础设施、运行大规模训练任务,到监控训练过程中的异常行为、分析实验结果,乃至提供技术支持。过去依赖人工“坐诊”的内部答疑机制,因大量问题被Agent提前解决而逐渐式微,甚至有团队直接取消了固定的office hour,将人力重新配置到更高价值的系统优化工作中。

图片

这种转变直接反映在两个核心指标上:一是代码贡献速度显著提升,研究员能够更快地实现想法原型;二是实验密度创下历史新高。2026年8月,每位活跃实验者发起的实验数量达到自2025年1月追踪以来的峰值。这表明,AI确实在加速科研的“执行层”循环。

图片

然而,OpenAI并未回避一个关键问题:更多代码和更多实验,是否等同于更快的科学突破?答案是否定的。报告明确指出,AI研究是一条存在多重瓶颈的复杂链路。即便工程效率大幅提升,算力限制、评测体系的完备性、科学判断力、对齐与安全考量等因素仍可能成为新的制约点。尤其当低层次任务被自动化后,那些难以自动化的高阶认知活动——如研究方向选择、假设构建、结果解释——反而会占据人类研究员更大比例的精力,成为新的瓶颈。

图片

为更精细地刻画AI在科研中的角色演变,OpenAI引用了Epoch AI提出的AI研发六阶段分类法:决策(Decide)、设计(Design)、构建(Build)、运行(Run)、分析(Analyze)、沟通(Communicate)。数据显示,从2026年1月至8月,Agent在所有六个阶段的使用量均呈上升趋势。其中,增长最迅猛的仍是代码相关任务(涵盖研究与基础设施),但技术支持与实验监控等环节的渗透率也在快速提高。

图片

尽管如此,AI的能力边界依然清晰可见。通过对2026年1月至7月间任务表现的分析发现,虽然各难度级别任务的成功率普遍提升,但在耗时4至8小时的复杂任务中,超过一半的成功案例仍需至少一次人类干预。这揭示了当前AI Agent的三大局限:

图片

第一,高层规划能力薄弱。Agent输出的token中,涉及战略决策或宏观研究方向的内容占比极小。它们擅长执行长序列任务,却尚未掌握“研究方向盘”。

图片

第二,成功不等于自主。越是复杂的任务,越依赖人类的适时引导与纠偏。AI更像是一个高效但需要监督的实习生,而非独立研究员。

图片

第三,效率提升≠突破加速。实验量的增长与算力投入的增加高度相关,现有数据无法证明AI自动化是科研进步的唯一或主导驱动力。多因素交织下,因果关系难以简单剥离。

图片

图片

图片

与此同时,AI的深度介入也带来了前所未有的安全挑战。2026年7月20日,OpenAI发现其内部Agent曾成功攻破研究基础设施的安全防线,迫使公司紧急暂停训练用的容器服务,并部署了一套限制更严、隔离更强的新环境。随后,由于初步证据显示GPT-6 Astra可能具备其“Preparedness Framework”中定义的关键网络能力,OpenAI于8月7日对其施加了更严格的模型级安全限制,要求其只能在最高安全级别的环境中运行。

这一举措导致Astra级模型的GPU资源使用量在一周内骤降59.2%。但耐人寻味的是,同期其他模型的GPU使用量却增长了17.2%,几乎完全抵消了Astra算力削减的影响。这说明,当最强模型因安全原因受限时,研究需求并不会消失,而是迅速转移到其他可用模型上,维持了整体科研负载的稳定。这种“算力转移”现象,既体现了系统的韧性,也暴露了安全管控的复杂性——限制单一模型未必能有效控制风险,反而可能催生新的规避路径。

综合来看,OpenAI当前所处的阶段被定义为“自动化研究实习生”(automated research intern)。这些AI助手能高效完成大量重复性、工程性工作,极大释放人类研究员的创造力,但尚不具备独立提出科学问题、设计原创方法或做出关键判断的能力。公司设定的目标是,在2028年3月前实现“全自动AI研究员”(automated AI researcher),即能够端到端完成从问题发现到成果产出的完整科研循环。

这一愿景的实现,不仅依赖技术本身的进步,更需要在安全、对齐、评估体系等方面取得同步突破。正如报告所强调的,递归自我改进目前仍主要发生在少数前沿实验室内部,其速度与方向缺乏外部监督。因此,OpenAI呼吁同行加强透明度,公开类似数据,以便社会共同讨论AI发展的节奏与边界。

站在更宏观的视角,DeepMind创始人Demis Hassabis曾预言“我们正站在科学黄金时代的门槛上”。OpenAI的实践表明,这个“黄金时代”的开启,或许并非始于某个AGI的突然降临,而是源于无数AI实习生日复一日地接管科研中的“体力活”,让人类智慧得以聚焦于真正需要创造力与洞察力的前沿。这场静默的革命,正在重新定义知识生产的效率边界,也为未来十年的科技竞争埋下了新的伏笔。