基元律动韩凯:用多模型调度和反馈闭环推动Agent持续进化

0 阅读

多模型并存是常态,关键是怎么用好

在2026年杭州云栖大会的企业级Agent实践峰会上,基元律动联合创始人兼CTO韩凯讲了一个很实在的问题:现在的大模型生态里,没有哪个模型能通吃所有任务。不同模型在能力、成本和响应速度上各有长短,而一个复杂的Agent任务往往要调用十几次甚至几十次模型。怎么在每一步都选对模型,同时控制成本,成了系统设计的核心挑战。

文章配图

国家数据局今年3月公布的数据显示,国内日均Token调用量已突破140万亿,比2024年初涨了上千倍。这背后是大量Agent应用在跑,而每一次调用都不是孤立的——它们串在一起完成一个目标。任务最终能不能成,不仅看单个模型强不强,更看整个执行框架能不能把合适的模型用在合适的地方。

韩凯把这套执行框架叫做Harness。它不只是个调度器,而是负责模型选择、工具调用、上下文管理等一系列支撑能力的综合体。其中最关键的一环,就是模型路由。

OpenSquilla:用对模型,也用得起模型

为了解决多模型协同的问题,基元律动开源了OpenSquilla项目。他们的思路很简单:别总用最贵的旗舰模型干所有活,而是根据任务步骤的复杂度动态分配模型。

测试结果挺有说服力。在一组端到端Agent评测中,OpenSquilla在保持任务质量达到固定旗舰模型基线99.96%的同时,把成本压低了88.9%。另一组更严苛的DRACO深度研究评测显示,多模型协同配置的得分甚至超过了实验中最强的单模型基线,而成本只有后者的三分之一左右。

“路由层的价值,在于让每一步任务用对模型、用得起模型。”韩凯说。这句话听起来朴素,但背后是对任务拆解、模型能力画像和成本效益分析的综合能力。

比如,一个Agent要处理用户查询,可能先用一个小模型做意图识别,再用中等模型生成结构化请求,最后才调用大模型做深度推理或内容生成。中间如果涉及简单计算或格式转换,甚至可以绕过语言模型,直接走规则引擎。这种细粒度的调度,才是降低成本又不牺牲体验的关键。

从调度到进化:RSI飞轮怎么转起来

但光会调度还不够。韩凯认为,真正的突破在于把Agent运行过程中产生的经验变成模型改进的燃料。他们把这个机制叫做RSI(Recursive Self-Improvement,递归式自我改进)飞轮。

具体来说,就是以实际场景中的能力缺口为起点,通过评测发现当前模型或调度策略的短板,然后针对性地做优化——可能是微调模型,也可能是调整路由规则。优化后的版本再回到真实场景中跑,验证效果,形成闭环。

这个想法不新,但难点在于如何让反馈真正可量化、可追溯、可行动。很多团队收集了一堆用户反馈,却不知道该优先改哪里。RSI的关键在于把“任务表现”作为核心指标,而不是泛泛的满意度或点击率。

NeoHorse-1:第一次闭环验证

今年9月发布的NeoHorse-1系列模型,就是RSI路径的初步尝试。它基于通义千问Qwen3.5底座做后训练,训练数据部分来自基元律动自家Agent产品在真实任务中的运行日志和失败案例。

初版技术报告显示,在十项基准评测中,NeoHorse-1-4B的宏平均得分从58.94提升到64.87,9B版本从65.60升到69.04。更有意思的是,4B版本在VitaBench、τ²-Bench、PinchBench、QwenClawBench和HumanEval这五项上,甚至超过了原始的Qwen3.5-9B底座模型,整体平均分也逼近9B水平。

这意味着什么?说明通过有针对性的数据筛选和训练目标设计,小模型也能在特定任务上超越更大的通用模型。而这背后,正是Agent运行中积累的“知道哪里会错、该怎么改”的经验在起作用。

合作生态:从模型到算力的协同

当然,这种闭环离不开合作伙伴的支持。韩凯提到,基元律动和阿里云围绕Qwen系列模型开展了多轮场景测试和应用验证。他们的Harness框架和Agent产品持续调用Qwen模型,积累反馈,并把这些经验用于推动新版本接入自家的TokenRhythm路由平台。

基础设施方面,阿里云提供云服务支持业务运行,而无问芯穹则为NeoHorse-1的训练和推理提供算力及底层优化。这种分工其实反映了当前AI工程化的现实:没有哪家公司能独自搞定从芯片到应用的全栈,协作成了必然选择。

调度与迭代,两条腿走路

总结来看,基元律动的思路很清晰:短期靠多模型调度降本增效,长期靠反馈闭环驱动模型进化。前者解决“当下怎么跑得稳”,后者解决“未来怎么变得强”。

这两者其实是互相促进的。调度系统越精细,收集到的反馈就越精准;反馈越精准,模型迭代的方向就越明确;模型越强,调度策略的空间就越大。这就是他们想构建的正向循环。

不过也要看到,RSI目前还处于早期验证阶段。NeoHorse-1的提升是在特定评测集上体现的,能否在更广泛的业务场景中复现,还需要时间检验。而且,如何避免反馈闭环陷入局部最优——比如过度拟合某些高频但简单的任务——也是接下来要解决的问题。

但无论如何,把Agent从“一次性部署”变成“持续进化体”,确实是行业往前走的关键一步。韩凯没讲太多宏大叙事,而是聚焦在怎么让系统更聪明地用模型、更有效地学经验。这种务实的态度,或许比任何技术细节都更值得留意。