阶跃星辰推Step5Preview:600B参数MoE模型,单任务成本为Claude Opus5的1/8

0 阅读

Step5Preview来了,成本砍到Claude Opus5的八分之一

9月20日,阶跃星辰发布了新一代基座模型Step5Preview。这不是一次常规迭代,而是明确冲着“高智能+低成本”这个矛盾点去的。官方称,它在处理真实世界中的Agentic任务(比如自动写代码、跑金融分析流程)时,单次任务成本只有Anthropic最新旗舰Claude Opus5的1/8。

QQ20260920-110628.jpg

这个数字很扎眼。要知道,Opus5是目前市面上最贵的大模型之一,按token计费动辄几美分。如果Step5Preview真能做到同等能力下成本骤降,对开发者和企业来说会是个不小的诱惑。

QQ20260920-110639.jpg

模型计划在10月15日正式开源,现在放出的是预览版。定位也很清晰:不做炫技的通用聊天机器人,而是当一个能长期扛住复杂任务的“主力工作模型”。

架构细节:600B总参,只烧27B

Step5Preview用的是稀疏混合专家(MoE)架构。总参数量标到了6000亿,但每次推理实际激活的参数只有270亿。这种设计思路很直接——用大量“专家”覆盖不同知识领域,但每次只调用最相关的那一小部分,既保证能力广度,又控制计算开销。

上下文窗口拉到了100万token,这意味着它能一次性处理整本小说或者几十份财报。更关键的是,它原生支持文本和视觉输入,不用额外接个视觉编码器。这对需要看图表、读截图的金融或工程任务来说,省了不少事。

官方没提具体训练数据规模或硬件配置,但强调了在软件工程、专业工作流和金融这三个场景做了针对性优化。比如自动修复代码bug、生成合规报告、解析非结构化财报数据之类的工作,应该是重点打磨过的。

智能和成本的平衡术

阶跃星辰提到一个概念:“帕累托前沿”。简单说,就是在给定成本下,模型智能能达到的理论上限。Step5Preview的目标就是把这个边界再往外推一点。

他们引用了Artificial Analysis Intelligence Index(AA综合智能指数)的数据,说Step5Preview在全球开源模型里排进了前三。这个榜单不算特别主流,但至少说明它在某些基准测试上表现不差。

不过要注意,这里说的是“开源模型”前三。像GPT-4o、Claude Opus这些闭源模型不在比较范围内。所以别误以为它已经全面超越商业旗舰,它的优势更多体现在“开源+低成本+特定场景”这个组合上。

为什么是现在?

过去一年,大模型竞赛明显从“拼参数”转向“拼落地”。很多公司发现,光有高智商没用,如果跑一次任务电费比人工还贵,根本没法规模化。

Step5Preview的策略很务实:不追求在所有任务上都第一,但在开发者真正要花钱跑的那些任务上,把性价比做到极致。比如一个程序员每天让AI review几百个PR,或者一个量化团队用模型扫描上千份公告,这时候成本差八倍就是生死线。

另外,选在10月开源也有讲究。年底是企业做下一年预算的时候,如果开发者能提前试用,很可能就把这个模型塞进明年的技术栈里。

开发者能怎么用?

虽然现在只是预览版,但可以猜一下后续动作。开源后大概率会放Hugging Face权重,配合推理框架(比如vLLM)和微调工具链。考虑到它支持多模态,说不定还会出专门处理PDF、Excel、代码仓库的预处理脚本。

对个人开发者来说,最大的吸引力可能是本地部署。27B激活参数意味着用几张消费级显卡就能跑起来,不像那些动辄上百B dense模型,非得上云不可。

企业用户则会更关注API定价。如果开源版免费,那托管API服务哪怕收点钱,只要比Opus5便宜一半,也会有很多人愿意迁过去。

别被参数数字忽悠

600B这个数听着吓人,但MoE模型的总参数其实参考意义不大。真正决定推理成本和延迟的是激活参数——27B。这跟Llama 3.1 405B MoE的激活规模差不多,属于当前高性能开源模型的主流水平。

关键还是看实测。比如在HumanEval(代码生成)或LiveCodeBench(实时编程)这类贴近真实开发的测试集上,它能不能稳稳压住同档位的Qwen-Max或DeepSeek-V3。官方没公布详细benchmark,得等社区评测。

另外,“原生支持视觉输入”具体指什么?是像GPT-4o那样端到端理解图文,还是只支持简单的图像caption?这点也得打个问号。

成本背后的真实挑战

把单任务成本压到1/8,听起来很美,但实际落地没那么简单。比如:

  • 长上下文的代价:100万token窗口虽然爽,但KV缓存占用会暴增。如果没做好的内存优化,推理速度可能慢得让人抓狂。
  • MoE的调度开销:专家路由(routing)本身也要算力。如果任务太杂,频繁切换专家反而会拖慢整体吞吐。
  • 金融场景的可靠性:金融数据容错率极低。模型说错一个数字可能引发连锁反应,光靠“能力强”不够,还得有严格的输出校验机制。

这些细节才是决定Step5Preview能不能从“纸面参数怪兽”变成“真·生产力工具”的关键。

开源的意义不止于免费

很多人觉得开源就是白嫖,但对阶跃星辰来说,开源Step5Preview更重要的目的是生态绑定。一旦开发者基于它构建应用、写插件、调优prompt,迁移成本就高了。未来就算推闭源增强版,也能顺理成章地收费。

而且开源能快速暴露问题。大模型在实验室表现好,不代表在真实业务流里稳定。社区贡献的bug report和优化建议,比内部测试有价值得多。

顺便提一句,这次没提是否包含商用授权。按国内厂商惯例,大概率会用类似Apache 2.0的宽松协议,但最好等正式开源时确认清楚。

接下来盯什么?

未来一个月,有几件事值得关注:

  1. 10月15日开源细节:权重格式、许可证类型、是否带推理示例。
  2. 第三方评测:尤其是AI编程和金融领域的垂直benchmark,别光看MMLU那种学术题。
  3. 实际API定价:如果开源免费,托管服务怎么收费?有没有用量阶梯?
  4. 工具链配套:有没有现成的LangChain集成、LlamaIndex适配器,或者VS Code插件?

总之,Step5Preview不是又一个“all-in-one”的通用模型,而是一个带着明确KPI出生的特种兵:在特定战场(专业工作流)用最低弹药消耗(成本)完成任务。成不成,还得看实战。