扩散语言模型能否颠覆自回归范式?端侧AI提速5倍背后的产业变局

3 阅读

近年来,大语言模型的发展几乎被自回归(autoregressive)范式所垄断——从GPT系列到Llama,再到国内众多闭源与开源模型,均采用“从左至右、逐个token预测”的生成策略。这种模式虽在语言建模上取得巨大成功,却在推理效率、全局一致性与端侧部署等方面面临结构性瓶颈。然而,一种源自图像生成领域的技术路径——扩散语言模型(Diffusion Language Model, dLLM)——正悄然崛起,并在关键性能指标上展现出颠覆性潜力。

图片

2024年9月1日,扩散智能(DiffuSpace)与亚洲智能体计算平台Acrab联合发布的一项测试结果引发行业关注:在端侧设备上运行AI Agent时,采用dLLM架构的模型相较传统自回归模型,任务执行速度提升约5倍。这一数据不仅验证了dLLM在实际应用场景中的效率优势,更预示着其可能成为下一代通用人工智能基础设施的重要候选者。

自回归的局限:串行生成与端侧算力浪费

自回归模型的核心逻辑是基于已生成的前缀序列预测下一个token。这种“一步一停”的生成方式天然具有串行依赖性——每一步都必须等待前一步完成才能继续。尽管现代GPU和NPU具备强大的并行计算能力,但在自回归推理过程中,这些硬件资源往往无法被充分利用。尤其在端侧设备(如手机、笔记本、车载芯片)上,算力有限且对功耗敏感,串行生成导致的低效问题被进一步放大。

更关键的是,AI Agent的工作流通常包含多个连续调用环节:任务规划、信息检索、工具调用、结果执行与校验。每一次模型调用若存在数百毫秒甚至数秒的延迟,整条链路的累积延迟将严重影响用户体验。例如,一个本地AI助手在整理日程时需同时读取邮件、分析会议记录、生成待办事项并同步日历——若每个步骤都因串行生成而卡顿,用户将难以忍受。

扩散语言模型的破局之道:全局框架 + 并行修正

dLLM的灵感来源于图像扩散模型(如Stable Diffusion),其核心思想是从噪声中逐步去噪,生成完整内容。在语言生成中,这一过程被转化为:先初始化一个包含所有位置token的“模糊草稿”,再通过多轮迭代,结合上下文信息并行修正各位置的内容,直至收敛为连贯文本。

这种机制带来两大根本性优势:

第一,并行生成能力。dLLM在每一轮去噪中可同时更新多个token位置,而非仅限于序列末尾。这意味着GPU/NPU的并行计算单元能被高效调动,尤其适合端侧芯片的硬件特性。测试数据显示,在代码生成等结构化任务中,dLLM单步可生成7–10个token,推理速度提升5–10倍。

第二,全局一致性更强。由于模型在生成初期就构建了整体语义框架,后续修正是在全局目标指导下进行的,避免了自回归模型常见的“开头精彩、结尾崩坏”问题。例如,在长篇报告生成中,dLLM能更好地维持论点连贯性与逻辑闭环。

Agent体验的质变:可编辑性与动态调整

dLLM对AI Agent的影响远不止于速度。其“全局草稿+局部修正”的机制赋予了模型前所未有的可编辑性。假设用户在对话中途修改了早期指令(如将“用Python写”改为“用JavaScript写”),自回归模型只能从修改点重新生成后续内容,此前已生成的代码全部作废;而dLLM则能识别哪些部分仍有效(如算法逻辑),仅重写受影响的语法结构,大幅减少冗余计算。

这种能力在复杂Agent任务中尤为关键。例如,一个自动驾驶Agent需同时处理感知、路径规划与控制指令生成。若环境突变(如前方出现障碍物),dLLM可快速调整整个决策链,而非逐层回溯重算。这种“整体响应”特性使其更接近人类的思维模式——我们并非逐字思考,而是先形成模糊意图,再逐步细化。

训练成本与工程生态:挑战与应对

当然,dLLM并非没有代价。其训练过程通常需要更多计算资源:模型需在不同噪声水平和位置组合下学习去噪,相当于“为最坏情况做准备”。但正如DiffuSpace团队所言,这是一种“training for the worst, testing for the best”的策略。考虑到模型只需训练一次却要服务海量推理请求,长期来看,推理效率的提升足以抵消前期投入。

更现实的挑战在于工程生态的缺失。自回归模型已拥有成熟的推理加速库(如FlashAttention)、量化工具链和部署框架,而dLLM的专用算子、内存优化策略和编译器支持仍处于早期阶段。DiffuSpace等先行者不得不自行开发底层基础设施,这无疑拖慢了产业化进程。

不过,这一局面正在改善。随着Google、Inception、蚂蚁集团等机构加入dLLM赛道,开源社区开始涌现相关项目。参数迁移技术也提供了捷径:已有自回归模型学到的语言知识可通过适配(adaptation)迁移到dLLM中,降低从零训练的成本。

从Dream 7B到AGI:技术演进与未来展望

DiffuSpace团队自2022年推出DiffuSeq以来,持续在dLLM三大核心难题——条件生成、离散信号建模与Scaling——上取得突破。2025年发布的Dream 7B模型首次在多项基准上全面超越同规模自回归模型,甚至在规划能力上媲美671B参数的DeepSeek V3,展现了“小模型大智能”的可能性。

团队认为,dLLM的真正潜力在于推动递归自我改进(Recursive Self-Improvement, RSI)。由于其擅长全局搜索与多样性探索,dLLM能同时生成多个解决方案候选,并通过验证器筛选最优路径,从而更高效地突破认知边界。这种能力被认为是通向人工通用智能(AGI)乃至超级智能(ASI)的关键。

尽管“两年内替代GPT类模型”的说法略显激进,但趋势已现。随着端侧AI需求爆发、硬件并行能力提升以及dLLM生态逐步完善,这场范式转移或许比预期来得更快。未来一年,我们将看到更多垂直场景的dLLM产品落地;未来两年,基础模型格局或将迎来深刻重构。

在这场技术路线的竞争中,胜负不仅取决于算法创新,更取决于谁能率先打通“模型-芯片-应用”的闭环。而端侧,正是dLLM证明自身价值的第一战场。