华为IJCAI 2026四篇论文:从规模竞赛到设计密度的技术转向

0 阅读

从规模竞赛到设计密度:华为IJCAI 2026论文的技术转向

AI领域的竞争正在经历一场静默的转型。过去几年,参数规模几乎是衡量模型能力的唯一标尺,但如今,算力成本的指数级增长与边际收益的递减,迫使研究者重新思考技术路径。华为在IJCAI 2026上收录的四篇论文,恰好勾勒出这一转型的清晰轮廓:从追求“更大”转向追求“更巧”,用架构设计和训练策略的精细化,对冲数据稀缺与算力昂贵的现实约束。

这四篇论文分别来自基础研究、AI数据、云服务和翻译服务中心,覆盖了视觉、视频理解、跨任务泛化和语音翻译四个方向。它们看似独立,却共享同一个底层逻辑:在资源受限的条件下,如何通过系统化的工程能力,最大化每一单位算力的智能产出。

层次化ViT的规模破壁:架构与训练的双重革新

视觉基础模型的规模化竞赛中,层次化ViT一直面临隐形的天花板。普通ViT的参数规模已突破22B,但层次化ViT始终停留在2B以下。原因在于,层级化模型对数据和训练策略的要求远高于普通ViT,简单套用后者的规模化方案往往导致训练不稳定或性能退化。

华为团队提出的Efficient Hierarchical ViT(EHV)架构,将这一上限推至30B参数。其核心创新在于两点:一是结构设计上,在保持多尺度特征提取能力的同时,引入稀疏专家混合(SMoE)机制,使得总参数达到30B,但推理时仅激活67亿参数;二是训练策略上,采用两阶段流程——先在ImageNet-21K上进行MAE自监督预训练,再在2700万图像数据集上从多个先进基础模型中蒸馏知识。

实验结果显示,EHV-5B-MoE在ImageNet-1K线性评测中达到89.0%的准确率,超越了总参数更大的EVA-CLIP-18B。更值得注意的是,其性能提升不仅限于图像分类,在视频分析和密集预测任务上同样表现优异。这表明EHV学到的是真正可泛化的视觉表征,而非过拟合于特定任务。

这项工作的意义在于,它证明了层次化ViT不仅能做大,而且能以更少的激活参数实现更高的准确性。架构设计决定了模型的能力上限,而训练策略则决定了这一上限能被释放多少。

输入前置筛选:可学习帧选择器的范式革新

视频-大语言模型(Video-LLMs)处理视频时,计算成本主要消耗在帧编码上。现有模型普遍采用均匀采样,但视频中的关键事件往往分布不均,导致重要信息被遗漏,而静态画面却浪费计算资源。查询驱动的方法虽在视频问答中有效,但在详细视频描述这类“无查询”任务中却无能为力。

华为AI数据团队提出的可学习帧选择器(LFS)提供了一种新思路:让模型自己学会“该看什么”。LFS的核心是“以终为始”的训练范式——不再学习“选哪些帧在中间得分上更高”,而是学习“选哪些帧能让大模型写出更好的描述”。

具体实现包含三个关键设计:第一,训练一个评分网络,为每帧打分;第二,采用分段选帧而非全局排序,确保时间轴上的均匀分布;第三,训练时,将选出的帧喂给冻结的Video-LLM生成描述,与人工标注对比计算损失,反向传播更新帧选择器参数,而大语言模型本身保持不变。

此外,团队还自建了新基准ICH-CC,视频来源于中国非遗烹饪的真实商业场景,所有描述和问答均由人工撰写,更贴近实际应用。实验表明,LFS在不同模型和基准上均带来稳定提升,证明了其通用性。

这项工作的启示在于,与其让模型在均匀采样的帧上“硬算”,不如在输入端做智能筛选。选对了帧,下游任务的表现自然提升,这为视频理解提供了一种成本效益更高的路径。

任务适配:表征模块化干预取代全模型微调

大语言模型的跨任务泛化能力,一直是研究热点。现有主流方案是per-token动态路由,但计算量和显存占用高。表征微调(ReFT)通过编辑前缀和后缀token的表征实现单任务适配,效率更高,但存在语义歧义和缺乏自引导机制的问题。

华为云团队与多所高校合作提出的表征感知模块化框架RaMod,将ReFT扩展到跨任务泛化场景。其核心包括两部分:一是双模块表征与参数微调,从中间层的隐藏表征中筛选出策略性子集进行干预,而非仅修改首尾token;二是异步调度器,主动分配和释放显存,将存储开销降至最低。

实验结果显示,RaMod在跨任务泛化效果上优于现有方法,同时额外预填时间减少83%,生成延迟降低100%,显存占用减少79%。这意味着,任务适配从“改模型”变成了“调表征”,一个底座模型配上若干轻量级干预模块,即可低成本服务不同任务场景。

当然,这种方法在复杂推理等高难度场景中的表现仍需进一步验证,但它为模型部署的经济性提供了新的可能性。

数据破局:语言专家各司其职,渐进训练步步为营

语码转换(Code-Switching)语音翻译任务,需要将夹杂多种语言的语音翻译成目标语言,其数据稀缺性是一大挑战。传统方法要么依赖模型自行领悟语义表征,效果不可控;要么依赖人工标注,成本高且规模有限。

华为翻译服务中心团队与厦门大学、澳门大学合作,提出了一种新思路:为每种语言单独建立“专家团队”,分别负责语义建模,最后统一对齐。具体实现包括两个关键设计:

一是MoE(混合专家)语音投影器。传统投影器对所有语言一视同仁,而MoE版本为每种语言分配一组专门专家,路由机制自动将语音特征送到对应专家组。为保证路由不跑偏,论文引入了语言特定损失和组内负载均衡损失。

二是多阶段训练范式。整个训练分四步:先用ASR数据分别预训练每种语言的投影器;然后组装成MoE结构,用语言特定损失和负载均衡损失联合优化;接着从ASR数据过渡到单语ST数据,用过渡损失平滑迁移;最后从ST数据适配到CS语音翻译数据。

实验对比了Whisper、SeamlessM4T、LLaST等强基线模型,在Fisher和NTUML2021的四个测试集上,该方法均超越表现最突出的SeamlessM4T,BLEU最高达39.52,COMET最高达81.33。

这项工作的价值在于,它证明了在数据稀缺的跨语言场景下,精细化的架构设计和渐进式训练策略,比单纯堆数据更有效。当然,在覆盖数十种语言的通用多语种系统中,其可扩展性仍需进一步论证。

设计密度:AI下半场的竞争焦点

回顾这四篇论文,它们分别从模型架构、输入处理、任务适配和数据利用四个维度,展示了华为如何用“设计密度”取代“规模密度”。30B层次化ViT重构了模型骨架,LFS在输入端做减法,RaMod将全量微调压缩为表征编辑,语码转换翻译则用MoE分工和渐进式训练弥补数据不足。

这些路径不依赖更多的芯片和算力,而依赖对问题本身更深刻的理解。当AI技术走出实验室,竞争早已不是某一项能力的单点突破,而是准确性、泛化性、数据、算力之间的系统统筹。每一个环节都可能成为瓶颈,也都可能成为突破口。

华为的这四篇论文,恰好从四个方向展现了这种系统化工程能力。它们传递的信号很明确:AI的下半场,对现实落地问题的理解,以及系统化解决这些问题的工程能力,才是真正的决胜点。