阶跃星辰发布 Step 5 Preview:600B 稀疏模型支持百万 Token 长任务
Step 5 Preview 是什么
Step 5 Preview 是阶跃星辰(StepFun)推出的新一代旗舰基座模型,目标很明确:让 AI 能在真实环境中长时间、自主地完成复杂任务。它不是那种只能回答问题的聊天模型,而是能写代码、调硬件、跑金融模型、生成 3D 内容,并且连续干上二十多个小时不“断片”的智能体。
技术上,它用了稀疏 MoE(Mixture of Experts)架构,总参数量达到 6000 亿,但每次推理只激活其中约 270 亿参数。这种“按需调用专家”的方式,让它在保持高性能的同时大幅压低了计算开销。官方称,其单任务成本只有 Claude Opus 5 的八分之一。
模型支持 100 万 Token 的上下文窗口,这意味着它能记住非常长的历史对话、工具返回结果和中间调试日志,在几十小时的任务链里不丢失上下文。同时,它原生支持文本和视觉输入,在同一个基座里处理,不需要额外的对齐模块。
在 Artificial Analysis Intelligence Index 评测中,Step 5 Preview 得了 44 分,位列开源模型前三,仅次于 GPT-6 Astra 和 Claude Opus 5——而后两者都是闭源商业模型。
能干什么:不只是聊天,而是干活
Step 5 Preview 的设计核心是“Agentic”,也就是具备代理能力。它不是被动应答,而是主动规划、执行、观察结果、再修正策略,形成闭环。以下是几个具体场景:
AI 编程与软件工程:它在 553 个真实代码仓库上训练过,覆盖 33 种编程语言。不仅能修 Bug、加功能、重构代码,还能操作真实硬件设备。比如,有测试案例显示,它能对一块 ESP32 开发板进行持续三小时以上的调试,根据串口返回的错误信息不断修改固件,直到设备正常运行。
长周期自主任务:模型能在无人干预的情况下连续工作超过 22 小时。一个典型例子是 GPU 内核优化——它从零开始调整 CUDA 代码,反复编译、测试、分析性能计数器,最终将内核性能推到 508 TFLOPS,超过了 Claude Opus 5 在同样任务上的表现(493 TFLOPS)。
前端与创意开发:它能调用 Blender 生成 3D 模型,再把这些资产接入基于 Three.js 的网页应用,实现从概念到交互式演示的一站式输出。这对游戏原型、产品可视化或教学工具开发很有帮助。
金融分析:模型具备三类能力:一是从海量新闻、财报、监管文件中检索并交叉验证信息;二是构建企业估值模型(如 DCF、可比公司法);三是产出结构化的深度研究报告。这些能力已在外部 FrontierFinance 评测中得到验证。
超长上下文理解:100 万 Token 的窗口不是摆设。在自动化后训练数据流程这类任务中,模型需要反复调用数据清洗、标注、质量评估等多个工具,每一步都依赖之前的结果。Step 5 Preview 能完整保留整个链条的状态,避免信息丢失导致的逻辑断裂。
技术怎么做到的
稀疏 MoE 架构:大而不贵
600B 总参数听起来吓人,但实际推理只激活 27B。这背后是精心设计的路由机制:输入进来后,模型会判断哪些“专家子网络”最适合处理当前任务,只调用它们。这样既保留了大规模模型的知识容量,又控制了计算成本。这也是它能做到“性能接近顶级闭源模型,价格却低得多”的关键。
长上下文持续追踪
百万 Token 不只是数字。为了不让长上下文变成“记流水账”,模型内部做了注意力机制优化,确保关键决策点、工具调用结果和错误日志能被有效保留和检索。在 24 小时任务中,它会定期总结阶段性成果,压缩冗余信息,把有限的记忆资源留给真正影响后续动作的数据。
Agentic 工具调用闭环
Step 5 Preview 的推理过程不是线性的。它会先拆解任务目标,生成初步计划,然后调用工具(如代码解释器、API、摄像头、串口)执行;拿到返回结果后,分析是否达成预期,若失败则诊断原因、调整策略、重试。这个“规划—执行—观测—修正”循环可以嵌套多层,支持复杂子任务分解。
原生多模态融合
文本和图像在同一个 Transformer 基座里处理,共享底层表示。这意味着模型看到一张截图时,不仅能识别 UI 元素,还能理解其背后的代码逻辑;反过来,当它生成一段前端代码时,也能预判渲染效果。这种深度融合减少了模态对齐的误差,提升了跨模态任务的可靠性。
效率 Scaling 路线
从 Step 3.5 Flash 开始,阶跃星辰就强调“效率优先”。Step 5 Preview 延续这一思路:不盲目堆参数,而是通过架构创新(如稀疏激活、长上下文压缩、工具调用缓存)把每一分算力都转化为实际任务能力。目标是把“能力—成本—效率”的帕累托边界往外推——同样的钱,能干更多事。
怎么用起来
目前 Step 5 Preview 提供多种接入方式:
在线体验:访问 Studio 平台,注册登录后即可在网页端直接对话。适合快速测试模型的基础能力和简单任务。
国内 API 接入:开发者可前往 开放平台 注册账号,创建 API Key 后按文档调用接口。支持配置上下文长度、工具调用权限等参数。
海外 API 接入:国际用户使用 platform.stepfun.ai,流程类似,但服务器部署在海外,延迟更低。
Agent 任务集成:在 API 调用时,开启长上下文和工具调用选项,就能让模型执行编程、金融研究等复杂工作流。例如,传入一个 GitHub 仓库链接和任务描述,模型会自动克隆、分析代码、修改、测试并提交 PR。
和竞品比怎么样
和当前最强的闭源模型 Claude Opus 5 相比,Step 5 Preview 在几个关键维度上有取舍:
| 对比项 | Step 5 Preview | Claude Opus 5 |
|---|---|---|
| 研发方 | 阶跃星辰 | Anthropic |
| 架构 | 稀疏 MoE(600B/27B) | 未公开 |
| Intelligence Index | 44 分(开源前三) | 略高 |
| 单任务成本 | 基准 | 8 倍 |
| 上下文窗口 | 100 万 Token | 20 万 Token |
| GPU 内核优化 | 508 TFLOPS | 493 TFLOPS |
| 开源计划 | 2026 年 10 月 15 日释放完整权重 | 闭源 |
可以看到,Step 5 Preview 在上下文长度、成本效率和特定工程任务(如 GPU 优化)上占优,而 Claude Opus 5 在综合智能分数上略胜一筹。但考虑到后者价格高、不开源,Step 5 Preview 对开发者和企业更具实用性。
实际应用场景
AI 编程助手:程序员可以把日常开发任务交给它——修 Bug、写单元测试、升级依赖、配置 CI/CD。支持 33 种语言意味着无论是 Python 脚本、Rust 库还是 Verilog 硬件描述,它都能处理。
科研自动化:研究人员常需要反复跑实验、调参、分析结果。Step 5 Preview 能接管整个流程:从读论文复现方法,到写训练脚本,再到监控 GPU 利用率并自动调整 batch size,最后生成实验报告。
硬件开发:嵌入式工程师可以让它读芯片手册,生成初始化代码,连接逻辑分析仪抓信号,根据波形调整时序。这种“软硬结合”的调试能力,过去只有资深工程师才能高效完成。
金融投研:分析师输入一家公司的 ticker,模型会自动拉取最新财报、新闻舆情、行业数据,构建估值模型,指出关键假设风险,并输出带图表的 PDF 报告。整个过程无需人工干预。
创意落地:设计师描述一个交互式 3D 场景(比如“一个可旋转的太阳能车模型,点击部件显示技术参数”),模型能生成 Blender 文件、Three.js 代码和部署说明,直接交付可用原型。
这些场景的共同点是:任务复杂、周期长、需要多工具协作。传统大模型往往在几步之后就“忘记”目标或混淆上下文,而 Step 5 Preview 的长记忆和自主纠错能力让它能坚持到底。
开源与生态
阶跃星辰计划在 2026 年 10 月 15 日开源 Step 5 Preview 的完整模型权重。这意味着社区可以自由微调、部署私有版本,甚至构建垂直领域的专用 Agent。在此之前,API 接入是主要使用方式。
官方也鼓励开发者贡献工具插件。比如,有人已经写了 Arduino 调试插件,让模型能直接烧录和监控开发板;还有人集成了 Bloomberg API,用于实时金融数据获取。这种开放生态有望加速 Agentic AI 在各行业的落地。

总的来说,Step 5 Preview 不是又一个“更强的聊天机器人”,而是一个能真正干活的智能体基座。它把大模型的能力从“回答问题”推进到了“完成任务”,而且是以一种成本可控、可长期运行的方式。对于需要自动化复杂工作流的团队来说,这可能是个值得尝试的新工具。