MIT拒绝的AI天才:五年前瞻预言成真,o1背后的关键推手浮出水面

1 阅读

2020年,一位年轻的研究者在麻省理工学院的面试现场遭遇了职业生涯中最尴尬的时刻。Giambattista Parascandolo站在讲台前,满怀信心地分享着关于GPT推理能力的前沿观点,却遭到面试委员会多数教授的强烈质疑,甚至被斥为'无稽之谈'。然而,历史往往充满戏剧性,这位被MIT拒绝的研究者,如今已成为OpenAI推理模型领域的关键人物,其前瞻性理论正在重塑整个人工智能的发展格局。

图片

五年前那份被质疑的报告,实际上包含了当今AI推理领域的核心理念。Parascandolo在报告中深入探讨了如何让人工神经网络突破训练分布的限制,获得更接近人类的泛化和规划能力。他认为,人类具备重新组合已有知识、识别关键不变量、建立抽象模型并完成长时程规划的能力,而人工神经网络在这些方面仍有巨大提升空间。这种洞察不仅具有理论价值,更为后续的技术突破指明了方向。

图片

报告中提出的核心概念——'开放式推理',如今已成为推理模型发展的基石。Parascandolo将其定义为:模型可以投入更多时间和计算资源,持续修正答案。问题越复杂,模型就应该进行更多层次的思考,并让额外的计算转化为更优的结果。这种设计理念与当前的推理时计算扩展技术高度吻合,展现了其惊人的前瞻性。

图片

传统的Transformer架构存在明显的局限性。标准的Transformer拥有固定的网络深度,每个token经历的前向计算量基本确定,但问题的难度与输入长度并没有稳定的对应关系。一个冗长的问题可能只需要简单的答案,而一个简短的问题却可能需要复杂的多轮拆解和验证。这种不匹配导致了推理效率的低下。

图片

相比之下,RNN看似更适合这类任务,因为它可以反复运行,理论上能够获得任意长度的思考时间。然而,Parascandolo通过实验发现,RNN通常只在训练时见过的推理步数附近表现最佳,继续增加循环次数,准确率反而可能下降。这一发现揭示了一个重要问题:增加计算量只是第一步,模型还需要学会如何有效利用这些计算资源。

图片

当时效果最强的多步规划技术,大量依赖模型预测控制和蒙特卡洛树搜索。神经网络主要负责预测环境或评估价值,而外部搜索算法负责展开未来路径。Parascandolo希望进一步将长程推理能力直接融入神经网络架构中,实现端到端的推理优化。

图片

他的第二个重要设想是让语言成为推理的载体。为了说明这一概念,Parascandolo以经典游戏《蒙特祖玛的复仇》为例进行了阐述。一个从零开始训练的强化学习Agent需要尝试大量的状态和动作组合,许多正确的操作本身并不复杂,Agent真正缺乏的是对'什么行为更合理'的判断能力。

图片

GPT模型已经从海量文本中吸收了丰富的世界知识,语言可以帮助模型描述环境、理解目标、拆解任务和生成高层计划,同时大幅缩小搜索空间。这种基于语言的推理框架,实际上预示了后来思维链、语言规划和Agent工作流的发展方向。

图片

Parascandolo提出的第三个方向更具革命性:人工智能系统可以重置任务,回到记忆中的任意状态,构造反事实场景,还可以调整模拟器中的时间、重力和观察结果。系统甚至可以直接读取、复制和修改自身的激活值与神经网络权重。

图片

这种设计相当于把学习过程本身也纳入Agent的操作空间。它能够开展刻意练习,生成特殊的训练场景,迁移已有知识,并针对失败轨迹重新学习。这种自我调节和自我改进的能力,代表了人工智能自主学习的高级形态。

图片

2021年6月,Parascandolo发表了一篇题为《反向传播、进化与'两只狗'的误区》的博客文章,主要反驳'神经网络需要海量数据,因此不像人脑'的观点。他认为,人类仅凭观察少数几只狗就能学会识别,并不代表此前没有积累经验。漫长的进化过程已经将祖先接触世界的经验,沉淀为人类大脑的结构和归纳偏置。

图片

按照这一视角,神经网络的大规模预训练可以类比生物进化,而模型微调和上下文学习才更接近个体一生中的学习过程。GPT-3读过的文本远超任何个人,但其预训练承担了压缩海量经验、塑造高效学习能力的作用。因此,不能直接将模型的全部预训练数据与一个人出生后的少量学习样本进行简单比较。

图片

这种理解也意味着,继续扩大数据和算力仍可能带来显著提升。他强调的是两者发挥的不同作用,而非认为梯度下降与生物进化的具体机制相同。这种类比为大规模预训练提供了理论支撑,也为后续的模型发展奠定了基础。

图片

Parascandolo的研究背景相当深厚。2017年,他进入马克斯·普朗克智能系统研究所和苏黎世联邦理工学院攻读博士学位,师从Bernhard Schölkopf和Thomas Hofmann,博士课题聚焦于深度学习中的OOD泛化问题。这一研究方向为他后来的推理理论奠定了坚实基础。

图片

博士期间,他在山景城的Google X和伦敦的DeepMind都进行过实习。在Google X,他参与了超大规模模拟器上的自动化设计研究;在DeepMind,他参与了分治蒙特卡洛树搜索研究。这些经历让他深入了解了不同机构的研究方法和技术路线,为其后来的跨领域创新提供了宝贵经验。

图片

2021年9月博士毕业后,Parascandolo直接加入OpenAI,最初进入John Schulman领导的强化学习团队,随后转向Mark Chen所在的算法团队,又加入了Jerry Tworek带领的草莓团队。值得注意的是,草莓团队正是o1项目的内部代号,这表明他从一开始就深度参与了这一重要项目。

图片

2023年,他参与了GPT-4的研发工作,并组建了一支专门研究推理的新团队。此后,他又参与了OpenAI o1和o3的基础研究,推动了奖励建模、环境构建和通用推理算法的扩展。其中一部分算法描述至今仍被他用黑块遮住,显示出这些技术的高度敏感性和重要性。

图片

从被MIT拒绝到推动o1项目成功,Parascandolo的经历反映了AI领域创新思维与传统观念之间的深刻冲突。学术界的保守态度可能错失了重要的发展机遇,而产业界的开放性则为前沿研究提供了实践平台。这种对比值得整个学术界深思。

图片

o1项目的技术突破很大程度上建立在Parascandolo早期理论的基础上。该模型在推理能力方面的显著提升,验证了其关于开放式推理、语言载体和自适应学习等概念的有效性。这种从理论到实践的成功转化,为AI推理领域树立了新的标杆。

图片

当前AI推理技术的发展趋势与Parascandolo五年前的预测高度一致。开放式推理架构正在成为主流,语言作为推理载体的理念得到广泛应用,而自适应计算资源分配的技术也在不断成熟。这些进展证明了其理论的前瞻性和实用性。

对于AI行业的从业者而言,Parascandolo的故事提供了重要启示。首先,创新思维往往面临质疑和挑战,坚持自己的研究方向需要勇气和毅力。其次,理论研究与实际应用之间存在密切联系,扎实的理论基础是技术创新的重要保障。最后,跨领域的知识整合能够产生意想不到的突破。

展望未来,推理模型的发展将继续沿着Parascandolo提出的方向前进。开放式推理架构将进一步完善,语言推理能力将持续增强,而自适应学习机制也将变得更加智能。这些技术进步将推动AI系统在复杂任务处理、逻辑推理和创造性思维等方面取得更大突破。

Parascandolo的经历也反映了AI人才流动的趋势。越来越多的优秀研究者选择进入产业界,将理论研究与实际应用相结合。这种趋势有助于加速技术转化,但也对学术界的人才培养和研究方向提出了新的挑战。

从更宏观的角度来看,这一事件揭示了AI发展过程中理论创新与实践验证的重要性。那些看似超前的理论观点,往往蕴含着未来技术发展的方向。保持对前沿理论的开放态度,给予创新思维足够的发展空间,对于推动整个AI领域的进步具有重要意义。

如今,当人们回顾2020年那场MIT面试时,不禁感叹历史的奇妙安排。那位被质疑的研究者,用实际行动证明了自己的理论价值,也为AI推理领域的发展做出了重要贡献。这个故事提醒我们,在面对前沿理论时,保持开放和包容的态度是多么重要。