DeepSeek V4.1 Flash上线:轻量多模态模型性能反超Pro版

0 阅读

DeepSeek 推出 V4.1 Flash,小模型干翻自家旗舰

深度求索(DeepSeek)最近上线了一款名字带“Flash”的新模型——V4.1 Flash。别被“Flash”误导成只是快,它其实是个正经的原生多模态模型,不仅能读文字,还能看图。更让人意外的是,这个定位“轻量”的版本,在多项能力上直接超过了自家之前的旗舰 V4Pro。

官方没绕弯子,直接说 V4.1 Flash 的设计目标就三个:能力上限更高、推理速度更快、吞吐量更大。听起来像是常规宣传话术,但这次的数据确实有点硬。

架构创新:不对称设计省下真金白银

V4.1 Flash 的核心是 552B 参数的混合专家(MoE)架构。不过,真正让它省资源的是那个叫 Causal-Encoder-Decoder 的新结构。简单理解,就是输入和输出走的是两条不同的路,计算量不对称。

具体来说,处理输入时只激活 8B 参数,生成输出时激活 16B 参数。这种“看的时候省着点,说的时候放开点”的策略,让整体计算成本比同体量的其他模型低了不少。配合新的预训练方法和更大规模的强化学习后训练,最终效果就是:一个标着“Flash”的小弟,把大哥 V4Pro 给比下去了。

KV Cache 大瘦身,存储成本断崖式下降

对大模型部署来说,KV Cache(键值缓存)是吃内存的大户,尤其在需要长上下文或多轮对话的 Agent 场景里,这部分开销能占到总成本的一半以上。

image.png

V4.1 Flash 在这方面下了狠手。相比上一代,它对高带宽内存(HBM)的需求降到了四分之一,对固态硬盘(SSD)的需求更是砍到了八分之一。官方甚至给出了一个更夸张的数字:和初代模型比,KV Cache 缩小到了原来的 1/437。这意味着同样一批硬件,现在能跑的服务量级完全不同了。

产品线大调整,V4Pro 开始谢幕

新模型一上线,产品线就得跟着变。DeepSeek 已经把 V4.1 Flash 接入了 API,用户只要把调用的模型名改成 deepseek-flash 就行。

与此同时,旧的 v4-flashv4-flash-vision-exp 已经下线,老名字现在会自动指向 V4.1 Flash。更关键的是 V4Pro 的命运——因为 V4.1 Flash 在性能、速度、成本上都全面胜出,官方决定让它光荣退休。

从 2026 年 9 月 14 日中午 12 点起,直到下一代 V4.1 Pro 发布前,所有发往 deepseek-v4-pro 的请求都会被悄悄转到 V4.1 Flash 上,并按新模型的价格收费。腾讯旗下的 WorkBuddy、CodeBuddy 和 OpenCode 等产品已经全量切换到了这个新模型。

定价策略:闲时价格打五折

既然成本降了,价格自然也得跟上。DeepSeek 同步下调了 V4.1 Flash 的 API 费用。为了更高效地利用服务器资源,新定价沿用了峰谷机制:闲时(通常是夜间或非工作时段)的调用价格是高峰时段的一半。

这个策略其实在鼓励开发者把一些非紧急的任务,比如批量数据处理、离线分析等,安排在晚上跑。既能省钱,又能帮平台削峰填谷,算是双赢。新价格已经在 9 月 10 日中午生效。

轻量不等于弱,反而成了新主力

过去我们总觉得“Pro”代表最强,“Flash”或者“Lite”就是阉割版。但 V4.1 Flash 的出现打破了这个惯性思维。通过底层架构的创新,它用更低的资源消耗,实现了更高的综合性能。

这背后反映了一个趋势:大模型的竞争不再单纯拼参数规模,而是转向了效率和性价比。谁能用更少的算力干更多的活,谁就能在实际应用中占据优势。对于开发者和企业用户来说,这无疑是个好消息——好用的模型,终于变得更便宜、更容易用了。