阿里云栖大会透露Qwen4.5将迈向5-10万亿参数规模

0 阅读

Qwen大模型进入自主进化阶段

2026年9月22日的云栖大会上,阿里巴巴展示了通义千问(Qwen)大模型在多个维度上的实质性进展。最引人注目的是,未来版本如Qwen4.5和Qwen5的总参数量将扩展至5到10万亿规模。这一数字远超当前主流大模型,标志着阿里在Scaling Law路径上的坚定投入。

文章配图

但参数增长并非唯一重点。更值得关注的是,Qwen3.8-Max已经能在人类完全不干预的情况下,自主完成模型训练的完整闭环。它自己搭建训练流程、构造数据、设计实验、定位缺陷,并持续运行超过一个月,完成了33轮有效迭代。这种递归自我改进(RSI)能力,让模型在Artificial Analysis基准测试中的得分从40提升到45,与Claude、GPT的顶级版本处于同一梯队,也明显领先于其他国产模型。

文章配图

芯片与模型协同优化取得突破

文章配图

除了算法层面的自我进化,Qwen还在硬件协同上迈出关键一步。Qwen3.8-Max在从未见过的平头哥新款GPU上,自主适配并优化了下一代Qwen3.8-Flash模型的推理框架,最终实现单实例推理吞吐量提升96%。这意味着同样的硬件能处理近两倍的请求,对实际部署成本影响巨大。

更进一步,模型甚至开始参与芯片设计。仅凭一份真实的总线模块规范,Qwen3.8-Max调用EDA工具超过一万次,在60多小时的连续运行中,完成了从前端设计到后端物理实现的全链路自迭代,最终将芯片面积减少了42%。这不再是单纯的“模型跑在芯片上”,而是“模型和芯片一起长出来”。

新架构大幅降低训练成本

阿里同步开源了Qwen3.8-Flash,作为下一代千问大模型的预览版。这个版本通过改进注意力机制和模型内部信息传递方式,在保持前沿性能的同时,将训练成本骤降近90%。同时,由于激活的参数极少,推理效率被推到新的帕累托前沿——即在同等计算资源下,性能更好;或在同等性能下,成本更低。

这种“性价比斩杀线”模型的意义在于,它让高性能大模型的训练和推理不再只是巨头的专利。结合阿里已开源的460多个Qwen模型,开发者可以基于这些高效架构快速构建自己的应用,而不必从零开始烧钱训练。

全模态能力持续扩展

在多模态方向,Qwen3.8-Omni正式亮相。它把音频、视频等不同模态统一纳入一个理解框架,相当于给大模型开辟了新的“思考分区”。用户不再需要为不同任务切换不同模型,一个统一接口就能处理图文、语音、视频混合输入。

图像生成模型Qwen-Image-3.1则针对电商、设计等商用场景优化,能把原本耗时数小时的视觉设计压缩到秒级交付,效果接近专业设计师水平,还支持精准编辑。比如修改商品图中的某个元素,而不影响整体风格。

音乐生成模型Happy Shrimp 1.1支持上百种曲风和十余种语言,覆盖人声歌曲与纯音乐。世界模型HappyOyster 2.0 Preview则在实时交互、记忆能力和物理规律遵循上显著提升,开始从实验室走向真实可用场景。

视频与语音模型迎来升级

阿里预告,全新的视频生成模型将于11月发布。新模型的目标是“更长、更可控、更完整、更智能”:在生成长时间视频时仍能保持人物和场景的一致性;创作者可以精确控制镜头、角色和环境;模型甚至具备导演级的叙事理解能力,不再只是拼接单个镜头,而是能把握整个故事脉络。

语音方面,Qwen-Audio-3.1家族全面升级。其中,ASR-Next不仅能转写文字,还能理解录音中的人类情绪、环境声、机械声,并回答“这段对话里说话人是否生气”这类问题。TTS-Next则能根据脚本直接生成包含对白和环境音的完整音频,极大提升有声书、播客等内容的制作效率。

实时交互模型Qwen-Audio-3.1-Realtime支持边听、边想、边说,多语言和共情能力也得到加强。它已落地到千问办公、Qoder,以及QwenNote A2随身助理、Eva桌面机器人和千问AI眼镜等硬件产品中。

同声传译模型Qwen3.8-LiveTranslate首次亮相,将翻译时延压缩到2.5秒以内,远低于人类同传平均4秒以上的延迟。该模型已集成到AI眼镜、A2助理和钉钉耳机中,为跨国会议提供近乎实时的翻译体验。

开源生态持续领跑

在技术推进的同时,阿里继续扩大其开源影响力。Qwen3.8-27B模型在Hugging Face上超越DeepSeek-R1、Llama3.1等热门模型,成为该平台历史上获得点赞最多的开源大模型。截至目前,阿里已开源460多个Qwen模型,总下载量突破30亿次,衍生模型数量超过30万个,稳居全球第一开源模型家族。

这种“全尺寸+全模态”的开源策略,不仅降低了行业使用门槛,也加速了整个AI生态的创新。开发者可以基于不同规模的Qwen模型快速验证想法,企业也能选择适合自身算力条件的版本进行私有化部署。

终端落地加速

大模型正从云端走向终端。阿里发布了专为手机场景优化的AI全栈解决方案Qwen Intelligence,为合作伙伴提供基于千问的Agent技术平台。这意味着未来的手机不仅能响应简单指令,还能可靠地执行跨应用的复杂任务,比如“订一张下周去上海的机票,选靠窗座位,预算不超过2000元,并同步到日历”。

随着Qwen在AI眼镜、桌面机器人、耳机等设备上的深度集成,大模型正逐渐成为日常交互的基础设施。而这一切的背后,是参数规模、架构创新、多模态融合和终端优化的共同作用。

阿里并未止步于追赶国际巨头,而是通过RSI、芯模协同、高效架构和全模态统一等路径,探索一条更具可持续性和实用性的大模型发展路线。Qwen4.5和Qwen5的5-10万亿参数目标,或许只是这场长期演进中的一个阶段性标志。