紫东太初GMC剪枝法:减少80%Token仍保多模态性能
视觉Token冗余:多模态模型落地的隐形瓶颈
近年来,视觉语言模型(VLM)在分辨率与图文理解能力上持续升级,图像被编码为数百乃至上万个视觉Token。这些Token在解码阶段全部参与计算,并长期占用KV Cache,导致显存开销剧增、推理速度下降、部署成本居高不下。尤其在长文档、高分辨率图像等场景中,Token数量可达数万,严重制约了模型的规模化应用。
行业普遍采用Top-K Token筛选作为压缩方案,即对每个Token独立打分,仅保留得分最高的部分。然而,这种方法存在明显缺陷:高分Token往往集中在画面显著区域,反复保留同质化信息,容易遗漏文字、数字、坐标轴等分散但关键的细节;同时,低分Token被直接删除,其携带的细节信息永久丢失,导致模型推理失真、事实判断偏差、视觉幻觉增多。业界因此陷入“压缩必掉精度”的困境。
GMC核心思想:从“选点”到“聚群”的范式转变
针对上述痛点,中国科学院自动化研究所紫东太初大模型团队提出核心集剪枝方法GMC(Grounded Message Coreset Pruning)。该方法跳出“筛选单个最优Token”的传统思路,基于模型真实推理逻辑,认为视觉语言模型依赖的是全体Token构成的“集体消息”,而非孤立图像块。因此,压缩不仅要确定“信息保留位置”,更要解决“保留Token的信息承载方式”。
GMC整体分为两大核心阶段:互补证据自适应筛选与群体互补信息传输。这一双阶段架构从根源上化解了Token冗余与信息丢失的矛盾,实现了高保真、高效率的视觉序列压缩。
互补证据自适应筛选:多维度证据的智能取舍
GMC同时从问题语义、视觉外观和空间位置三个角度构建证据。首先,利用视觉语言模型内部原生的视觉-文本注意力,识别与当前问题直接相关的区域;其次,根据视觉特征之间的相似性保护图像中的不同外观结构,避免模型只关注当前已被问题激活的内容;最后,通过原始图像坐标构建空间证据,保留图表、文档以及关系推理任务中重要的位置和几何信息。
在选择关键Token时,GMC根据其对“尚未覆盖证据”的新增贡献进行选择。当某一区域已得到充分表示后,附近相似Token的价值随之降低,系统转而选择能够补充文字、目标、数字或空间关系的其他区域。由此,有限的Token预算被分配给多种互补信息,而不是反复集中在同一显著位置。这种机制确保了压缩后的Token集能全面覆盖推理所需的关键证据。
群体互补信息传输:让每个Token都“物尽其用”
仅仅选出具有代表性的位置并不能完全解决信息丢失问题,因为未被选中的Token仍携带着细节信息。GMC因此进一步提出Population Transport群体互补信息传输机制,将所有待删除Token的隐藏状态传输到最合适的代表Token中。该过程综合考虑视觉特征相似性和空间邻近关系,将大量视觉Token聚合为少量紧凑表示。语义匹配清晰的内容可被传输到相似代表,而容易混淆的局部细节则更倾向于保留在附近位置。聚合完成后,未选中的视觉Token被删除,模型随后在压缩后的Token序列上继续执行注意力计算。
与需要重新训练模型或引入外部工具的方法不同,GMC不需要任务标签、参数更新、辅助检测器、OCR模型或额外模型,可以直接应用于已有视觉语言多模态大模型中。同时,GMC实现的是真实序列压缩,而不是简单地通过掩码隐藏Token,因此能够实际减少后续解码层计算和KV Cache占用。
核心优势:零成本适配,压缩不降质
GMC方案具备四大核心优势,使其在众多压缩方法中脱颖而出:
- 全程免训练,无额外依赖:无需模型微调、任务标签、外部OCR/检测器或辅助模型,开箱即用,直接兼容Qwen、LLaVA等主流视觉语言大模型。
- 压缩不降质,自带去噪增益:过滤无效冗余Token的同时完整留存推理所需视觉证据,多项基准测试中性能持平甚至优于原始完整模型。
- 抑制视觉幻觉,事实一致性更强:在POPE、HallusionBench等幻觉评测集表现突出,大幅减少压缩后模型错描述、信息缺失问题。
- 跨模型通用,全场景适配:可迁移至不同架构7B级多模态模型,覆盖通用图文问答、图表解析、长文档识别全业务场景。
权威实验:超高压缩率下的性能奇迹
团队基于TextVQA、ChartQA、MME、POPE、MMBench、GQA等多项主流视觉理解基准,在Qwen2.5-VL-7B-Instruct、LLaVA-1.5-7B模型上完成全量验证。
在Qwen2.5-VL-7B上,完整模型包含1296个视觉Token。当视觉Token数量减少80.2%、仅保留256个时,GMC-H2保留了完整模型97.78%的平均能力;当进一步减少90.1%、仅保留128个视觉Token时,GMC-L16仍保持99.11%的平均能力。在LLaVA-1.5-7B上,GMC-L16在分别保留128个和64个视觉Token时,平均性能达到完整模型的99.76%和99.82%,表明该方法能够迁移到不同视觉语言模型架构。
值得注意的是,GMC方法性能与基线模型性能一致甚至略高于基线模型,表明GMC不仅可以减少计算量,甚至可以通过移除无关信息达到去噪效果,进而轻微提升模型的多模态理解能力。
除了常规视觉问答能力,研究团队还在POPE、AMBER、HallusionBench和CHAIR等基准上评估了模型的视觉幻觉。实验结果表明,在相同Token预算下,GMC能够更加完整地保留事实判断所需的视觉证据,在显著压缩视觉序列的同时减少错误描述和信息遗漏。
在长文档问答场景中,面对包含15876个原始视觉Token的输入,GMC在保持完整模型98.87%问答质量的情况下,实现了1.258倍端到端推理加速,并减少73.94%的提示KV Cache,验证了该方法在实际部署中的效率优势。
未来展望:重塑多模态部署新范式
随着多模态大模型向高分辨率、长上下文、复杂真实场景演进,Token冗余带来的算力、显存成本问题,已经成为产业规模化落地的核心阻碍。紫东太初GMC不仅是一款全新的核心集剪枝方法,更提供高效、可信的多模态部署新范式:视觉压缩的核心不是减少Token数量,而是以更低的计算代价,完整支撑模型精准推理所需的全局视觉信息。
未来,紫东太初大模型团队将持续迭代GMC技术体系,适配更多大模型架构与复杂业务场景,持续破解多模态模型“算力成本与推理精度”的核心矛盾,推动国产多模态大模型高效、低成本、规模化落地。