NeoHorse-1 开源:专为智能体任务设计的 4B/9B 模型

1 阅读

NeoHorse-1 是什么

NeoHorse-1 是由基元律动(TokenRhythm)联合无问芯穹、清华大学、北京大学、香港中文大学、阿里巴巴等机构共同推出的开源智能体(Agent)模型。它有两个参数规模:4B 和 9B。与通用大模型不同,NeoHorse-1 从训练数据到优化目标都围绕“完成任务”展开,而不是单纯追求对话流畅或知识覆盖。

这个模型最大的特点是采用了 Agent-Native 后训练 方法。训练数据不是来自问答对或网页文本,而是来自一个叫 Routing Harness 的系统在真实执行任务时留下的结构化轨迹。这些轨迹记录了从用户请求、模型决策、工具调用、环境反馈到错误恢复的完整过程。通过这种方式,模型学到的不是“怎么回答”,而是“怎么做事”。

在官方评测中,NeoHorse-1-9B 在十项 Agent 相关基准上的平均得分为 69.04,比其底座模型高出 3.44 分。它原生支持 262,144 个 token 的上下文长度,理论上可扩展到约 101 万 token,适合处理需要长时间记忆和多步骤推理的任务。模型以 Apache-2.0 协议开源,支持本地部署。

核心能力:不只是聊天,而是做事

NeoHorse-1 的设计目标很明确:让模型能像人一样操作电脑、调用工具、写代码并完成复杂任务。它的四大核心能力包括:

  • 工具调用:根据任务需求自动选择并调用外部工具。比如,用户说“把上周的销售数据做成图表”,模型会先调用数据库接口获取数据,再调用绘图工具生成图表。
  • 任务规划:面对复杂目标,能拆解成多个子步骤,并安排执行顺序。例如,“准备季度汇报”可能被分解为“收集数据→整理PPT→生成演讲稿→检查格式”。
  • 深度搜索:不是简单地返回一段信息,而是在多轮交互中主动检索、交叉验证,并构建证据链。比如回答“某政策对中小企业的影响”,模型会查找政府文件、企业财报、专家评论等多个来源,并说明依据。
  • 代码生成与调试:不仅能写出代码,还能根据运行结果自动修复错误。如果第一次生成的脚本报错,模型会分析错误信息,修改后重试,直到任务成功。

这些能力不是靠提示词(prompt)临时激发的,而是内化在模型行为中的。这也是为什么它在 Agent 专用评测中表现优于参数量更大的通用模型。

技术原理:用真实轨迹训练“做事”的模型

Harness 轨迹驱动的训练

传统大模型的训练数据主要是“问题-答案”对,但 Agent 需要的是“目标-行动-结果”的完整链条。NeoHorse-1 的训练语料来自 Routing Harness 系统的真实执行日志。这些日志包含:

  • 用户原始请求
  • 路由器对任务难度的判断(C0–C3 四档)
  • 模型选择的工具和参数
  • 环境返回的执行结果(成功或失败)
  • 错误发生后的恢复尝试

相比问答数据,这种轨迹多了三个关键维度:能力需求(任务需要什么技能)、执行决策(模型做了什么选择)、环境结果(世界如何反馈)。训练时,成功和失败的轨迹都被保留下来,经过结构校验和六维质量评估(如逻辑性、工具使用合理性等)后用于微调。

能力引导的数据配比

光有数据还不够,怎么配比也很关键。NeoHorse-1 利用了路由信号来动态调整训练数据分布。具体做法是:

  1. 将每条轨迹拆成“预测—行动—结果”三段;
  2. 用“预测段”(即路由器对任务难度的判断)作为课程排序依据,决定哪些任务先学、哪些后学;
  3. 用“结果段”分析模型在哪些能力档位(C0–C3)上表现差;
  4. 根据短板,在下一轮训练中增加对应难度的数据比例。

这样就形成了一个闭环:评测反馈 → 数据配比调整 → 模型更新 → 新一轮评测。模型越练越强,而且强在真正需要的地方。

递归自我改进(RSI)的初步验证

项目还探索了递归自我改进(Recursive Self-Improvement, RSI)机制,分为两部分:

  • Data-RSI:模型在 Harness 中持续执行新任务,产生的新轨迹经过筛选后成为下一轮训练数据,实现数据的自然积累。
  • Model-RSI:根据评测发现的短板更新模型,然后将新模型放回 Harness 的模型池中参与后续任务。

目前,团队只验证了单次闭环的有效性。整个过程中的奖励函数和路由信号仍由人类设定,尚未实现完全自动化。但这为未来 Agent 的持续进化提供了可行路径。

如何部署和使用

NeoHorse-1 支持本地部署,对开发者比较友好。以下是基本使用流程:

  1. 安装 ModelScope:执行 pip install -U modelscope 获取命令行工具。
  2. 下载模型:运行 modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B。如果显存有限,也可以选择 4B 版本。
  3. 启动推理服务:推荐使用 SGLang(pip install "sglang==0.5.17")或 vLLM。启动时需指定超长上下文和专用解析器:
    --context-length 262144 \
    --reasoning-parser qwen3 \
    --tool-call-parser qwen3_coder
  4. API 调用:服务启动后,默认监听 http://localhost:8000/v1。你可以用 OpenAI SDK,只需将 base_url 指向该地址,其余调用方式不变。

Loomy

需要注意的是,虽然模型支持 26 万 token 上下文,但实际可用长度受 GPU 显存限制。如果部署时报错,可以先将 --context-length 调低(比如设为 32768),确保服务能正常启动。

性能表现:小模型,大能量

在官方公布的对比中,NeoHorse-1-9B 在多个 Agent 专用基准上全面领先 Qwen3.5-9B:

  • QwenClawBench(模拟真实电脑操作任务):48.73 vs 44.04
  • PinchBench(标准化工作流):82.25 vs 74.55(高出 7.7 分)
  • BFCL v4(函数调用准确性):67.43 vs 64.88
  • tau²-Bench(多轮工具交互):90.82 vs 88.04
  • HumanEval(代码生成正确率):98.17 vs 92.68

十项综合均分 69.04,比底座模型高 3.44 分。更值得注意的是,4B 版本在某些任务上已经能媲美甚至超过一些 7B–13B 的通用模型。这说明,针对特定场景优化的小模型,可能比“全能但泛化”的大模型更实用

应用场景:从办公自动化到研究助理

NeoHorse-1 的定位非常清晰:做那些需要“动手能力”的任务。典型场景包括:

  • 智能体任务执行:作为 OpenClaw 等框架中的执行引擎,自动完成文件整理、软件操作、数据导出等真实电脑任务。即使中途出错,也能尝试恢复。
  • API 编排与自动化工作流:在企业内部,自动组合多个 API 完成复杂流程。比如“收到客户订单 → 查询库存 → 生成发货单 → 通知物流”。
  • 深度研究助理:帮助研究人员进行文献综述。模型会主动检索论文、提取关键结论、对比不同观点,并附上引用来源,生成带证据链的报告。
  • 职场办公自动化:在 WorkBuddy Bench 这类模拟职场环境中,处理跨部门协作任务,如协调会议时间、汇总周报、生成可视化报表等。

这些场景的共同点是:任务多步骤、依赖外部工具、需要容错和恢复能力。而这正是 NeoHorse-1 的强项。

开源生态与未来方向

NeoHorse-1 已在 GitHub、Hugging Face 和 arXiv 全面开源:

模型采用 Apache-2.0 协议,允许商用,且兼容主流推理框架如 SGLang、vLLM 和 Ollama。这意味着开发者可以轻松将其集成到现有系统中。

未来,团队计划进一步完善 RSI 机制,探索更自动化的训练闭环。同时,也可能扩展支持更多工具类型和操作系统环境,让 Agent 能在更复杂的现实场景中发挥作用。

总的来说,NeoHorse-1 不是一个“更好的聊天机器人”,而是一个“会做事的数字员工”。它的出现,或许标志着大模型从“能说会道”向“能干实事”的重要转变。