MiniCPM5-2B 开源:端侧模型首次具备通用 Agent 能力雏形

1 阅读

端侧也能跑 Agent?MiniCPM5-2B 给出了肯定答案

过去几年,端侧大模型的能力一直在悄悄升级。一开始大家只关心手机能不能跑一个能聊天的模型;后来长文本理解、数学推理、多语言支持陆续被塞进小模型里。现在,一个新的问题冒了出来:Agent 能力,能不能也搬到设备上?

图片

这可不是换个壳子那么简单。一个真正的 Agent 得能听懂目标、拆解步骤、调用工具、根据反馈调整策略,还得在多轮对话里把事情办成。这些活儿以前基本都得靠云端大模型干,因为需要大量算力和复杂的逻辑链。

图片

但随着端侧模型越来越强,这套复杂工作流开始有了本地运行的可能。面壁智能最近的动作,就把这事往前推了一大步。

图片

9 月 8 日,他们开源了新一代端侧语言模型 MiniCPM5-2B。这个只有 20 亿参数的小模型,却把工具调用、深度搜索、代码生成这些 Agent 的核心能力都装了进去。更重要的是,他们没只扔个模型权重出来,连训练配方(比如 RL recipe)、自研强化学习框架 Meshy、奖励驱动的 JustRL II 算法,还有一批 SFT 数据,全都一并开源了——这在当前的大模型圈子里可不多见。

图片

轻量不等于弱,MiniCPM5-2B 在榜单上赢了更大的对手

图片

别看 MiniCPM5-2B 参数少,实力可不弱。在 Artificial Analysis Intelligence Index 榜单上,它在开源模型类别里排第一。这个榜单综合了 9 项测试,涵盖知识推理、代码能力和 Agent 任务执行。结果是,MiniCPM5-2B 拿了 23 分,比 Gemma 4 12B、Qwen3.5 9B 这些参数大得多的模型还高。

图片

专门测 Agent 工作流的那个子榜,它更是以 20 分断层领先,Granite 4.2 8B 只拿了 9 分,Qwen3.5 9B 更是只有 7 分。

图片

效率上也有优势。完成一个任务平均只需要约 21K output tokens,在同规模模型里算很低的。这意味着在手机或笔记本上跑起来更省电、更快。

图片

最让人意外的是,它在真实工作任务评测里,成绩已经接近人类基准线。这说明端侧模型不再只是回答“今天天气怎么样”这种简单问题,而是真能处理实际业务了。

图片

它的“智能密度”也很高——用更少的参数干更多的事。综合能力评测平均分 53.9,超过了 Qwen3.5-2B 等同类模型。而且这个提升不是靠某一项能力拉高平均分,而是在代码、数学、工具调用、搜索等多个维度都比较均衡,属于整体变强。

图片

这些数字背后,真正重要的是:端侧通用 Agent 的雏形,真的出现了。

图片

从预训练到强化学习,全程为 Agent 能力铺路

图片

MiniCPM5-2B 的特别之处在于,它不是后期加了个插件就号称支持 Agent,而是从预训练阶段就开始为 Agent 能力打基础,一路贯穿到 SFT(监督微调)和大规模强化学习对齐。这样确保出来的能力是稳定可用的,不是那种“能跑但总出错”的半成品。

图片

在强化学习阶段,团队用了自家研发的两个关键东西:Meshy 框架和 JustRL II 策略。

图片

Meshy 是个去中心化的 RL 训练框架。它彻底砍掉了传统 RL 里那个中央控制器,也不依赖 Ray。所有训练、推理、奖励计算都被建模成对等服务,靠 TransferQueue 里的数据就绪状态来驱动流程。好处是能轻松在同步、异步、全异步三种模式间切换,扩展性更好。

JustRL II 则是为了解决端侧模型做长思维链 RL 时的老大难问题:训练分数不升反降。原因有两个:一是训练数据噪声多、难度不匹配,奖励信号容易带偏模型;二是 GRPO 算法信用分配太粗糙,面对上万词元的推理链,根本分不清哪步对哪步错。

JustRL II 的解法很实在:数据上,用三阶段流水线筛掉不可靠样本;算法上,给 GRPO 加了个 Critic 模块,实现词元级别的信用分配。实测下来,这招确实管用,RL 后训练带来了明显的性能提升。

实际跑起来什么样?我们试了几个典型任务

光看榜单不够直观,我们自己动手测了测。模型已经开源,感兴趣的人可以自己下载部署。

第一个测试是处理一篇 AI 生成的长会议纪要。我们连续问:“本次会议缺席人员是谁?”“Atlas V2.0 正式上线日期是哪一天?”结果 MiniCPM5-2B 能准确从长文本里提取关键事实,还能区分讨论过程和最终结论,给出的答案完全正确,日常办公够用了。

第二个任务是从 5 份简历里提取每个人的姓名、年龄、工作年限、核心技能,再整理成结构化表格。模型不仅准确抓取了信息,还完成了后续的匹配分析。整个过程数据没离开本地,对企业来说,这类涉及敏感信息的任务,放在端侧跑显然更安心。

第三个测试是网页生成。我们只给了个简单描述,比如“做一个包含导航栏、产品介绍和联系表单的页面”,MiniCPM5-2B 就生成了完整的 HTML/CSS/JS 代码,布局合理,功能模块齐全。

这几个例子说明,MiniCPM5-2B 确实开始具备“理解任务—处理信息—生成结果”的端侧 Agent 能力了。

不只开源模型,连数据治理方法也一并公开

除了算法,数据质量对端侧模型尤其关键。参数有限,就必须用更高质量的数据来弥补。面壁智能这次把支撑 MiniCPM5-2B 的数据体系也开源了,包括新工具 UltraX 和三个数据集。

UltraX 是个函数调用式的精炼框架。和传统用大模型重写整篇文本不同,它训练了一个只有 0.6B 参数的小模型,专门预测编辑操作:保留、删除、替换、插入。然后由一个确定性执行器把这些操作应用到原文上。

传统做法是文档级过滤——整篇文章质量差就全扔掉。但好内容和垃圾常常混在一起,全扔损失太大。UltraX 像个精细编辑,逐行判断“这段留、那段删、这句换个说法”。这样既避免了重写带来的语义漂移,又因为编辑操作可保存、可审计,整个过程完全透明。

效果上,在 FineWeb、RedPajama-v2 等五个主流语料上验证,用 UltraX 精炼后的数据训练 1B 模型,只用 16B tokens 就超过了原始数据训满 20B tokens 的效果。目前 UltraX 已经开源,一度登顶 Hugging Face Datasets Trending 榜首。

同时开源的还有三个数据集:

  • UltraData-Code:做代码数据分级治理。从 1.92 亿 GitHub 仓库起步,经过多轮过滤、去重,最后聚焦到算法相关代码,并拆解成任务描述、解题分析、参考实现和测试代码对齐的结构化样本。
  • UltraData-SFT-Agent-2609:约 50 万条 Agent 训练样本,覆盖工具调用、网页搜索、代码执行、Office 文档处理、金融数据库交互等场景,既有短指令,也有需要多轮规划的长任务。
  • UltraData-RL-2609:超 8 万条 RL 训练数据,专门针对数学、代码、问答和长文本理解。通过三阶段流水线解决“答案无法验证”“奖励不可信”“难度不匹配”三大痛点,提供高质量训练信号。

其实,数据开源一直是面壁智能和 OpenBMB 社区的重点。过去几年他们已经开源了 UltraChat、UltraFeedback、UltraInteract_sft 等 10 多个数据集,覆盖预训练、对齐、推理全流程。截至 2026 年 9 月,UltraData 系列下载量已超 266 万次。

开发者能拿它做什么?

MiniCPM5-2B 从设计之初就考虑了开发者体验。

推理端,它支持 SGLang、vLLM、llama.cpp、Ollama、Hugging Face,还有面壁自研的 CPU 推理框架 Arclight,基本覆盖了所有主流本地和云端部署方式。

微调端,兼容 Llama Factory 和 ms-swift,开发者可以快速用自己的数据做领域定制。

最值得期待的应用,是那些对隐私敏感的任务:聊天记录整理、会议纪要分析、合同问答、内部邮件处理……这些事如果交给云端模型,数据就得上传,企业总有顾虑。端侧模型让数据留在本地,既降低隐私风险,又省了云端调用费用。

另外,端侧 Agent 能力也让批量任务变得高效。比如同时批改几十份试卷、筛选上百份简历、并行拆分合同集,现在都可以在本地低成本完成。

端侧 Agent 的出现,意味着什么?

过去几年,大模型竞赛主要在云端上演:拼参数、拼算力、拼训练成本。但 AI 要真正融入日常生活和产业流程,光有云端超级大脑还不够。用户需要的是触手可及的智能——就在自己的设备上。

MiniCPM5-2B 的意义,就是在有限参数下,把 Agent 的核心能力搬到了端侧。它证明了,20 亿参数的模型也能理解任务、调用工具、完成工作,而不只是一个轻量版聊天机器人。

更关键的是,面壁智能这次开放的不是单一模型,而是一整套方法论:从数据精炼、预训练、SFT 到强化学习,连框架和算法都一并开源。开发者拿到的不仅是一个可用的模型,更是一套可以继续迭代和创新的基础设施。

未来的 AI 形态,很可能不是只有云端一种答案。云端负责超复杂推理,设备侧处理高频、隐私敏感的任务,两者协同,才是更可持续的路径。

2B 参数当然不是终点,但它清晰地划下了一条线:当 Agent 能力开始进入端侧,AI 正在从遥远的数据中心,走向每个人手中的设备。