中国NeoLab崛起:EverMind三篇论文揭示全栈自进化AI技术路径
自进化AI:从概念到落地的关键一跃
2026年,人工智能领域最炙手可热的方向,莫过于“自进化AI”。这一概念的核心,是让AI系统在部署后不再是一成不变的静态模型,而是能够通过自我迭代、持续学习,实现能力的不断跃升。海外众多顶尖AI研究者纷纷离开大厂,创立了被称为“NeoLab”的研究型团队,押注这一前沿方向,并获得了惊人的融资。然而,当聚光灯都打在海外团队身上时,一家中国团队——EverMind,却用连续三篇高质量论文,交出了自进化AI领域第一份全栈技术答卷,引发了业界的广泛关注。
海外NeoLab热潮:愿景宏大,落地寥寥
“NeoLab”一词,最初用于描述那些从OpenAI、Google DeepMind等顶级机构出走,专注于下一代AI技术独立创业的研究团队。他们的共同特征是研究驱动、长期主义,并瞄准最具挑战性的技术难题。2026年,这股浪潮达到了顶峰:
- Recursive Superintelligence (RSI):由前Salesforce首席科学家Richard Socher和前Meta FAIR科学家田渊栋联合创立,在团队不足30人、尚无产品的情况下,获得6.5亿美元融资,估值高达46.5亿美元,并与AWS签署了4.1亿美元的算力协议。其目标是训练一个具备“5万名博士”能力的系统,自动化AI研究本身。
- Ineffable Intelligence:由AlphaGo之父David Silver创立,估值51亿美元。
- Engram:以6亿美元估值完成9800万美元A轮融资,专注于参数化权重记忆。
- Adaption Labs:以10亿美元估值获得5000万美元种子轮,主攻推理时适应。
- Core Automation:估值目标直指40亿美元,由前OpenAI研究副总裁Jerry Tworek创立,旗舰项目Ceres专注于持续学习模型。
这些团队押注的核心命题,都指向同一个方向:如何让AI在部署后能够通过自我迭代实现持续进化,即“递归自我改进”或“自进化AI”。然而,仔细审视这些估值惊人的NeoLab,会发现他们大多仍停留在单点突破的理论探索阶段:RSI尚未公布具体方案;Engram缺乏脚手架层的灵活进化机制;Adaption Labs没有长期技能沉淀体系;Core Automation也还没有公开的论文和开源生态。
EverMind:中国NeoLab的异类与传承
与海外团队的喧嚣不同,EverMind显得格外低调。这家由盛大集团孵化的AI研究团队,延续了盛大创新院的研究基因。2008年,陈天桥在盛大集团内部创立盛大创新院,其定位不是做产品、不追KPI,而是纯粹探索技术前沿,这在当时流量为王、变现至上的互联网时代,是一种极为罕见的企业内研究文化。十余年后,时代切换到了AI,盛大集团All in AI,通过内部孵化机制在全球范围内吸引顶尖AI人才,EverMind正是其中一支。
EverMind从一开始便选择了一条在商业上看似“最难”、技术上却“最根本”的路:解决AI的长期记忆问题,并在此基础上探索AI的自进化之路。团队负责人邓亚峰曾提出一个核心判断:“从长期记忆,结合持续学习,走向自我进化是下一代AI的核心技术路线。”这句话精准地概括了EverMind的技术战略:记忆是Agent积累经验的载体,自进化是把经验转化为能力跃升的路径。
三篇论文,三大突破:EverMind的全栈自进化技术栈
EverMind连续发布的三篇论文,分别瞄准了自进化AI的三大核心难题:脚手架(Harness)的自我改进、技能(Skills)的规模化管理、模型权重(Weights)的训练信号分配。
HarnessBank:让Agent安全改写自身逻辑
在实际部署中,模型权重往往是冻结的,因此修改Agent外围的“脚手架”(Harness)——包括提示词、注入的知识、运行时控制逻辑等——成为提升性能的最直接手段。然而,让模型自己修改这些代码,最大的难点在于避免过拟合:模型自我生成的反馈往往充满噪声,一个看似有效的修改,可能只是针对特定测试集的过拟合,换个场景就会导致灾难性崩溃。
EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》中,提出了一套全新的框架,让Agent能够自主诊断失败并重写自己的运行逻辑,同时从根本上解决过拟合问题。其核心创新在于将“提出变更”与“归因变更”彻底分离:语言模型只负责诊断失败原因并提出补丁,而所有的采样、测量和显著性检验全部交由确定性的代码逻辑控制,确保每一个被系统认可的性能提升在统计意义上绝对可靠。
更创新的是其引入的“装备基因库”(Harness Gene Bank, HGB)机制。传统的自进化系统以“任务”为键存储改进,极易导致系统只学会解决特定问题。EverMind则将每一份高性能脚手架以“WHERE × WHY”(改动作用在哪个环节、为何被引入)作为语义坐标存档,支持通过故障诊断进行“重新发明”或跨单元进行“机制重组”,防止搜索过程陷入崩溃或原地打转。这种设计引入了强大的抗过拟合归纳偏置——系统学到的不是“如何解决这道题”,而是“如何修复这类病理”。
实验结果显示,在冻结任务Agent权重的情况下,HarnessBank在Terminal-Bench-2、LiveCode、Omni-MATH等七个多样化基准上,取得了5.1%到15.4%的一致性能提升,且所有增益均通过了配对显著性检验。更令人惊喜的是,跨模型实验证实,这些性能提升来自模型特异性的自进化过程,而非存在一个“万能脚手架”。获胜的补丁追踪的是模型的主导“病理”,而非模型的大小或家族。这意味着,EverMind构建的这套“诊断-归因”循环机制,是一种可以跨模型迁移的元能力,证明了AI for AI的技术可行性。
SkillCorpus:十万技能库背后的工程与科学
如果说Harness的自进化赋予了Agent重写逻辑的能力,那么“技能”(Skills)则是Agent沉淀经验的具体载体。在EverMind的Raven框架中,内置了高达10万项开箱即用的技能。这并非简单的数量堆砌,其背后的工程与科学支撑,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》。
随着开源社区中技能文件(如Skill.md格式)的爆发式增长,这些资产呈现出严重的碎片化、冗余和质量不均。EverMind团队构建了SkillCorpus框架,首次在规模化层面上对开放技能生态进行了聚合、策展、匹配和评估。他们从爬取的大约82.1万个原始技能中,通过多阶段多维度策略过滤,最终精选出96401个高质量技能,并建立了包含16个类别的分类法,从实用性、鲁棒性和安全性三个维度进行严格质量控制。
仅仅有库还不够,关键在于检索。EverMind配合这个庞大的语料库,微调了一套专门的检索与选择技术栈,确保Agent在执行任务时能够精准匹配到相关技能。在SkillsBench、GDPVal和QwenClawBench三个基准测试中的端到端评估显示,自研的Raven Harness集成SkillCorpus后,Agent在所有基准上均获得了稳定的性能提升,其中在SkillsBench上的提升最大,达到了7.5个百分点。通过深入的运营分析,团队还识别出了技能带来的增益边界——覆盖边界和Harness边界,为未来优化指明了方向。
更重要的是,技能并非一入库就固定不变。无论是人工编写的技能,还是AI自动生成的技能,EverOS都能依据任务执行的成败经验对其持续打磨:用得好的被强化、被复用,用得差的被修正、被淘汰。技能库因此不是一份静态清单,而是一个随任务不断自我进化、越用越强的资产。
DASH:让模型看清哪里出了错
自进化的最深层,是模型权重的自我迭代。EverMind的最新论文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》,展示了其在底层算法上的深厚功底。
传统的同策略自我蒸馏(OPSD)存在一个致命的时间盲区:它对所有局部散度(即学生与教师的差异)分配相同的系数,完全忽略了错误发生的时间顺序和上下文。EverMind的研究团队通过对大量真实推理轨迹的分析,发现了一个关键现象:在一个推理序列中,局部散度值的大小与未来散度的演变之间存在极弱的关联。这意味着,用同一个系数来处理所有时间步的散度,本质上是在用一把尺子量所有不同形状的错误,必然导致监督信号的严重失真。
为了解决这一问题,EverMind提出了DASH。其核心思想是将每个局部蒸馏信号与序列级均值之间的差距,转化为一个自适应的传播门,然后利用这些门控制向后的多步聚合。当一个时间步的局部散度高于序列均值时,说明这里是一个高风险分叉点,DASH会打开一个更大的传播门,让这个时间步的监督信号向前传播更远;反之,传播门收窄,避免无关紧要的步骤干扰整体学习。
实验结果显示,在AIME 2024、AIME 2025和HMMT 2025三个极具挑战性的数学推理基准上,DASH在Qwen3-1.7B、Qwen3-4B和Qwen3-8B三个模型规模上均取得了所有对比方法中的最高分。在Qwen3-1.7B上,DASH将三个基准的平均得分从vanilla OPSD的41.87提升至45.07;在Qwen3-8B上,从65.00提升至66.40。更重要的是,DASH不需要引入任何额外的教师或学生前向传递开销,这意味着这种性能提升几乎是“免费”的。
四层递进体系:EverMind的自进化框架全景
将三篇论文的技术栈与EverMind内部的产品和研究框架相结合,可以清晰地看到其自进化路径的完整图景——一个从任务层到元改进层的四层递进体系:
任务层:进化在单次任务中即时发生,优化对象是单次任务的执行质量,包括记忆的提取与回写、技能的即时沉淀与复用。经验来源是Context、Trace与用户反馈,更新动作是即时回写,验证方式是结果与反馈。这一层的能力复利是“记得更牢、用得更顺、单次任务做得更好”,价值定位是沉淀任务级、可复用的记忆与技能资产。这正是EverOS与SkillCorpus所覆盖的核心场景。
脚手架层:优化对象是Code与Policy,即Agent外围的运行逻辑与控制策略。经验来源是Eval与Reflection,更新动作是脚手架的版本迭代,验证方式是Agent Evals复盘。这一层的能力复利是“更会执行”,价值定位是可复用行为资产的持续积累。这正是Raven框架与Self-Evolving Harness论文所对应的工作。
模型层:优化对象是模型本身,经验来源是高价值轨迹、偏好与失败样本,更新动作是LoRA与端侧模型的验证后灰度,验证方式是离线集加灰度测试。这一层的能力复利是“更准、更省”,价值定位是个性化的专属模型能力。DASH论文正是这一层的核心算法支撑。
元改进层:优化对象是Evaluator、Data与Training Recipe本身,经验来源是多轮实验与Benchmark,更新动作是优化“提出—选择—验证”的整个循环,验证方式是版本门槛加评测体系。这一层的能力复利是“下一轮进化更快、更可靠”,价值定位是让改进能力本身也持续升级。
这个四层框架的深刻之处在于,它把自进化拆成了四个层层递进又彼此支撑的环节,并为每一层都配备了具体的技术路径与验证机制。它不是一张空洞的愿景图,而是一个有工程细节、有学术支撑的完整路线图。
对比海外坐标系:EverMind的独特优势
将EverMind与海外那些估值惊人的NeoLab进行对比,可以更清晰地看到其独特之处:
- RSI:提出了宏大的“自动化AI研究闭环”理念,但尚处于纯研发阶段,无成型产品或框架落地。
- Engram:专注于参数化权重记忆,但缺乏脚手架层的灵活进化机制,且需要白盒访问模型权重,实际部署受限。
- Adaption Labs:主攻无梯度推理时适应,但缺乏如SkillCorpus这样庞大且经过策展的外部经验沉淀体系,也没有在底层训练算法上进行深度优化。
- Core Automation:方向最为接近,但仍在早期研发阶段,缺乏完整的技术栈和开源生态。
相比之下,EverMind的独特之处在于其“三层并发”的战略纵深。它没有陷入“参数化记忆”与“非参数化记忆”的非此即彼的争论,而是通过EverOS(非参数化长期记忆)、Raven(Harness自进化)和DASH(底层权重训练优化)构建了一个全栈生态。更重要的是,EverMind坚持开源优先,通过在GitHub上积累的超过1.2万颗Star(同期mem0为7千),正在迅速建立起类似Android的底层开发者生态护城河。
中国NeoLab的时刻:从盛大创新院到EverMind
在互联网时代,盛大创新院曾是中国企业内研究文化的先行者,被后来的互联网及各领域巨头纷纷效仿;在AI时代,EverMind也正在成为中国NeoLab浪潮中最具研究深度的代表之一。仅仅一年间,团队就在长期记忆与自进化领域产出9篇高质量论文,其中数篇被ACL、KDD等顶会录用。这意味着EverMind的自进化不只是一个工程化产品,更有扎实的底层技术与严谨的学术支撑:DASH让模型在训练时“看清自己错在哪里”,Self-Evolving Harness让Agent在运行时安全地重写自身逻辑,SkillCorpus让Agent的成功经验被规模化地沉淀与复用。三者合一,构成了一个从“感知错误”到“修改逻辑”再到“沉淀记忆”的完整自进化闭环。
但这条路,EverMind并不想独自走完。团队诚挚邀请各领域的伙伴与之同行,一起共同构建AI长期记忆的基础设施,把持续学习与自我进化推向科学、具身、金融、智能硬件等更广阔的场景。在定义“数字生命”下一个形态的道路上,中国的研究型团队,已经来了。至于更精彩的部分,才刚刚开始。
参考文献
- HarnessBank论文:https://arxiv.org/abs/2607.13683
- SkillCorpus论文:https://arxiv.org/abs/2607.15557
- DASH论文:https://arxiv.org/pdf/2608.06243v1