小红书开源dots3-note:280B MoE模型如何重塑长程Agent任务?

8 阅读

引言

在人工智能领域,大型语言模型(LLM)的竞争日趋白热化,而多模态与长程任务处理能力正成为新的突破口。2025年,小红书dots模型实验室悄然开源了dots3-note preview,这是IMO 2026满分模型同系列的首个版本,以其独特的MoE架构和强大的长程Agent能力,迅速吸引了业界的目光。本文将从技术原理、核心功能、应用场景等多个维度,深度解析dots3-note preview的亮点与潜力。

技术架构:280B MoE的极致参数效率

dots3-note preview采用混合专家(MoE)架构,总参数高达280B,但激活参数仅16B,这一设计在保证模型容量的同时,大幅降低了推理成本。具体而言,模型包含256个路由专家和1个共享专家,每层通过Top-8路由机制选择激活专家,并配备5120维隐藏层和152K词表。这种稀疏激活的方式,使得模型在推理时仅需计算部分专家,从而在算力受限的环境下也能高效运行。

多Token预测加速

为了进一步提升推理速度,dots3-note内置了一个1.13B参数的共享多Token预测层。该层能够在生成当前token时,并行预测后续最多3个token,无需独立的草稿模型即可实现推测解码。这一创新机制有效降低了推理延迟,提升了吞吐量,尤其适合需要实时响应的应用场景。

多模态编码器融合

在多模态支持方面,dots3-note采用了一个7B总参数/1.2B激活的MoE ViT编码器处理视觉信息,以及一个800M参数的稠密网络编码音频。各模态特征经过投影后与语言模型对齐,实现了文本、图像、视频、音频的统一理解与跨模态推理。这种设计使得模型能够处理复杂的多模态任务,如视觉空间判读、文档图表解析和视频问答。

核心功能:长程开放域Agent的突破

dots3-note preview的定位并非传统的问答或代码生成,而是专攻长程开放域Agent任务,如旅行规划、婚礼筹备等无唯一答案、时间跨度长的复杂任务。这类任务要求模型具备自主规划、持续跟踪和动态调整的能力,而dots3-note通过以下机制实现了这一目标。

自主学习与纠错

模型在未知规则环境中,通过观察提出假设并验证,出错时启动Self-Critiquing机制进行自我批判,并将修正后的规则写入外部memory.md动态记忆文件。这种跨步骤的知识累积与策略调整,使得模型能够在长程任务中不断优化决策,避免重复犯错。

端到端软件工程

dots3-note能够独立完成从需求分析、技术选型、代码实现到编译验证的完整开发流程。例如,在visionOS原生应用开发中,模型参考设计图即可完成SwiftUI+RealityKit代码编写、Xcode工程构建与模拟器验证,实现从0到1的空间应用交付。

交互式任务执行

无需专门训练,dots3-note即可接管游戏、破解ARC-AGI等需要实时反馈与长程策略调整的任务。在《杀戮尖塔 II》等策略游戏中,模型能够根据实时战局学习敌人机制,动态管理牌组、金币与药水,做出全局最优决策。

使用指南:从云端到本地部署

云端API调用

用户可访问官方平台(https://dots.ai/platform/)注册账号并获取API密钥,直接通过云端接口调用模型,无需本地部署。这种方式适合快速体验和轻量级应用。

本地部署

对于需要深度定制或数据隐私保护的用户,可从Hugging Face仓库(dots-studio/dots3-note-prev)下载Apache-2.0协议下的模型权重,并安装vLLM、SGLang或Transformers等推理框架。由于模型总参数达280B,需配置张量并行(TP)与专家并行(EP)策略,将计算分布到多块GPU上以满足显存与性能需求。

竞品对比:dots3-note vs DeepSeek-v4-flash

与DeepSeek-v4-flash-0731相比,dots3-note在多个维度上展现出独特优势。

对比维度 dots3-note preview DeepSeek-v4-flash-0731
参数规模 280B总/16B激活 284B总/13B激活
架构 MoE(256路由+1共享,Top-8) MoE
上下文窗口 512K 128K
核心定位 长程开放域Agent 通用高效推理与代码生成
长程任务 专为复杂任务优化,支持Self-Critiquing与动态记忆 侧重代码与数学推理,长程开放任务非主攻方向
多模态 文本、图像、视频、音频统一理解 以文本为主,多模态能力相对有限
开源协议 Apache-2.0,全量开源 开源权重,协议相对受限
适用场景 个人助理、复杂生活规划、端到端软件开发、游戏策略 代码生成、数学解题、轻量级推理任务

从对比中可以看出,dots3-note在长程任务和多模态方面具有明显优势,而DeepSeek-v4-flash则在通用推理和代码生成上表现均衡。用户可根据实际需求选择合适的模型。

应用场景:从生活助手到专业开发

智能装修顾问

用户上传户型图、家电尺寸图并语音描述需求,模型自动计算空间适配性,检索风格案例,生成定制化装修方案网页并提醒现场复尺。这一场景充分利用了多模态理解和长程规划能力。

独立游戏代练Agent

在策略游戏中,模型接管游戏角色,根据实时战局学习敌人机制,动态管理资源,做出全局最优决策。这展示了模型在交互式任务中的强大适应能力。

婚礼全流程策划师

从预算分配、场地筛选、宾客名单管理到流程时间表制定,模型在数周内持续跟进,根据突发变动动态重新规划。这体现了长程任务中的持续跟踪与调整能力。

跨模态深度研究助手

针对学术或商业课题,模型自主执行多轮搜索、阅读PDF图表、观看视频资料,整合多源信息生成结构化研究报告,并在发现矛盾时启动Self-Critiquing修正结论。

未来展望与挑战

尽管dots3-note preview展现了强大的能力,但其280B的总参数规模对部署硬件提出了较高要求,普通开发者可能难以负担。此外,长程任务中的动态记忆机制虽然有效,但在极端复杂场景下仍可能面临知识冲突或遗忘问题。未来,随着模型压缩技术和推理优化的进步,这类模型有望在更广泛的硬件上运行,进一步推动AI在真实世界任务中的应用。

结语

dots3-note preview的发布,标志着开源多模态MoE模型在长程Agent任务上迈出了重要一步。其极致的参数效率、强大的多模态理解和自主学习能力,为AI应用开辟了新的可能性。无论是作为个人助理、专业开发工具,还是研究平台,dots3-note都值得深入探索。我们期待小红书dots实验室在未来带来更多创新,推动AI技术向更实用、更智能的方向发展。