蚂蚁集团IJCAI 2026论文盘点:AI如何学会“随机应变”?

2 阅读

从静态求解到动态自适应:蚂蚁集团IJCAI 2026论文的技术脉络

在人工智能领域,实验室中的模型精度不断刷新纪录,但一旦部署到真实世界,性能衰减几乎成为常态。原因很简单:真实世界从来不是静止的。蚂蚁集团的业务场景将这种“不静止”推向了极致——超10亿用户、8000多种服务,支付洪峰与凌晨低谷之间可以差出几个数量级,风控模型必须以小时级响应黑产策略的迭代,全球化部署还要适配各国迥异的金融基础设施。在这样的环境里,“一次训练、永久部署”的静态模型,注定陷入“刻舟求剑”的困境。

蚂蚁集团入选IJCAI 2026的四篇论文,不约而同地回答了一个核心命题:如何让AI从“静态的求解器”进化为“动态的自适应者”?这四篇论文分别从无监督学习、强化学习、黑盒优化和多模态评估四个方向切入,共同指向了从静态到动态的范式转换。

MSRGC-Net:让时间序列聚类自适应数据密度分布

时间序列聚类是将海量行为序列自动归类的基础工具,广泛应用于行为模式理解和异常信号监控。然而,现有方法各有短板:相似度方法(如k-Shape)能抓局部模式,但需要计算所有样本两两之间的距离,数据量一大就难以扩展;深度学习方法(如自编码器)表征能力强,但训练成本高、调参复杂、算力消耗大;传统特征提取依赖人工设计,可能丢失关键的时间动态信息。

更大的挑战在于,现实中的时序数据密度分布极不均匀——双十一交易数据密集如暴雨,凌晨数据则稀疏如滴水,而传统方法往往需要预先指定聚类数目,这与现实情况严重错位。

蚂蚁集团联合重庆邮电大学提出的MSRGC-Net,用一套“无训练”的组合拳,绕开了精准度和计算效率之间的两难选择。其核心逻辑分为三步:

第一步,多尺度储备池编码(特征提取)。 使用多个无需训练的回声状态网络(ESN)作为储备池计算的基本单元,仅靠调整谱半径就能从原始时序中同时提取局部波动和长期趋势,将所有样本聚合后形成视图特征矩阵,作为后续环节的输入。

第二步,“颗粒球”锚定图构建(结构建模)。 这是最巧妙的部分。算法不再盯着单个数据点,而是根据数据的局部密度自动划分“颗粒球”:密度高的区域形成小而多的颗粒,密度低的区域形成大而少的颗粒。数据规模从N压缩到M(颗粒数,M < N),同时噪声干扰也被抑制。

第三步,基于共识的多尺度图优化。 跨尺度的锚定图通过共识策略融合,使模型既能捕获微观局部模式,又能把握宏观全局趋势,最终生成无需人工指定聚类数目的鲁棒聚类结果。

在5个多变量基准数据集、15项评估指标(NMI、ARI、RI各5项)上,MSRGC-Net拿了12项最优、2项第二——80%的最优率。更关键的是,它避开了O(n²)的成对计算,实现了近线性的复杂度。简单说就是:又快又准,而且不需要你猜要分几类。在蚂蚁的实际业务场景中,这意味着系统能根据流量密度自动调整聚类粒度——高峰时精细分群抓异常,低谷时粗粒度概括省算力,始终跟着数据走。

ROAD:让离线到在线强化学习自适应数据混合策略

强化学习有个著名的“水土不服”问题——“分布偏移”:在离线数据上训练好的模型,一上线就容易“失忆”。这是因为离线数据和在线交互数据之间存在分布差异,导致在线初期策略迅速“遗忘”离线学到的知识。

现有的解决办法无非两种:要么固定50%离线+50%在线这样的混合比例,要么用启发式规则优先采样“近策略”的样本。但问题是,策略在不同阶段的需求完全不一样——早期需要更多离线数据稳住基本盘,后期需要更多在线数据探索新可能。固定策略,就是刻舟求剑。

蚂蚁集团联合上海交通大学提出ROAD,把数据混合比例从一个“预设参数”变成了“动态决策变量”。它的核心思想是:数据选择本质上是个双层优化问题。内层是标准的Q学习更新,即最小化贝尔曼误差;外层将数据混合策略视为元决策变量,以最大化在线策略的预期回报为目标。两层通过多臂老虎机(MAB)算法近似求解,使得混合策略能够在训练过程中实时调整:一旦发现模型开始“遗忘”离线阶段学到的知识,就自动调高离线数据的采样比例来稳住基本盘;当模型趋于保守、探索不足时,又及时增加在线数据的占比,鼓励它去试错。

实验在离线到在线强化学习的三大经典基准上进行了验证:AntMaze(机器人在迷宫中寻找目标)、MuJoCo(仿生机器人的运动控制)和FrankaKitchen(机械臂在厨房中完成复杂操作)。这些任务难度不同、状态空间各异,能比较全面地检验算法的泛化能力。为验证ROAD的算法普适性,研究团队将ROAD和IQL、PEX、CQL、Cal-QL等多种主流离线算法“嫁接”在一起。结果显示:无论底层用哪种算法,ROAD都能稳定带来性能提升。以PEX+ROAD为例,该方法在D4RL基准的24个连续控制任务上取得了71.12的总体平均分,24个任务里有18个排第一,显著优于固定比例、递减比例、启发式平衡回放等所有基线。

ROAD能够让模型在“保守继承”和“激进探索”之间找到最优平衡点——既不会一上线就翻车,也不会错失实时数据带来的提升机会。该方法对蚂蚁集团风控模型上线、推荐系统实时优化这类场景而言,价值很鲜明。

DSEBO:让高维贝叶斯优化自适应搜索子空间

贝叶斯优化是黑盒函数优化的经典方法,但一碰到高维问题就头疼。一种常见解法是随机嵌入——把优化投射到低维子空间,但新问题来了:有效维度到底是多少?传统方法要么依赖专家经验给定固定子空间维度,要么通过试错法反复估计,不仅消耗大量资源,且固定的子空间维度难以适配不同任务。更麻烦的是,有效维度本身可能随优化进程变化:初期探索时低维度就够用,后期精调时可能需要更高维度的细节。

蚂蚁集团联合华东师范大学、南京大学提出的DSEBO,让子空间维度成为优化进程中的“动态变量”,随搜索进度自主切换。其核心机制是“从低到高,逐级跃升”:

  • 从低维子空间出发,优化器在低维空间生成候选解,经随机嵌入映射至原始空间,并快速摸清目标函数的大致轮廓,然后结果反馈驱动高斯过程迭代更新;
  • 观察到收敛后自动触发维度扩展,通过共享嵌入矩阵把低维解“继承”到高维;
  • 新子空间初始化和继续优化,由共享嵌入矩阵确保各子空间相互嵌套,形成“低维探索→收敛触发→维度扩展→继续优化”的循环,直到达到评估预算上限。

其中维度扩展环节,扩展幅度也不是固定的——算法会根据当前最优值变化曲线自适应调整:曲线平缓就慢点扩,省不必要的开销;曲线陡峭就快点扩,快速捕捉高维增益。

实验在合成函数(Levy、Griewank、Sphere,D=1000)和三个真实任务(MSLR、Lasso-Hard、LIMO)上,与REMBO、SIRBO、BAxUS、TuRBO等十几种主流方法逐一对比,几乎所有任务上都拿下了最优解——精度和收敛速度双双领先。这套“低维探路、高维精调”的打法,在蚂蚁的日常研发中也很实用——信贷模型的超参数调优、风控策略的阈值寻优、营销活动的多变量实验设计,不再需要专家拍脑袋估计维度了,算法自己会“边走边看”,实现了自动化、高效率的运行。

VGA-BenchV2:让视频评估基准自适应AIGC生态的进化

如果说前三篇论文讨论的是算法层面的自适应,那么VGA-BenchV2展示的是评估基础设施如何“自适应”AIGC技术生态的迭代。这也是四篇论文中唯一聚焦多模态内容理解的工作,映射了蚂蚁集团在数字生活、内容生态等非金融领域的战略储备。

AIGC让视频生产大爆发,但一个核心问题卡住了:我们怎么系统性评估这些生成视频的质量?传统评估指标如FVD(评估整体质量与时序连贯性)、CLIP Score(评估生成图像与文字描述的语义一致性),主要看画面清不清晰、动作连不连贯、文本对不对得上。至于构图精不精妙、光影讲不讲究、色彩和不和谐——这些关乎“美感”的感知品质,它们几乎无能为力。

此前CVPR 2026上,蚂蚁联合北京电影学院、通用人工智能研究院(BIGAI)提出了VGA-Bench,首次为视频审美评估建立了三维度框架(美学质量、美学标签、生成质量),并基于1016个提示词、12个生成模型、超6万个视频构建了评估基准,让AI第一次学会了从专业视角“鉴赏”视频。但视频生成模型进化太快,以月为单位的迭代节奏让固定基准很快就“不够用了”。在这篇IJCAI 2026论文中,团队又进一步推出VGA-BenchV2。

核心进化有三点:

第一,人工标注量级增加。 VGA-BenchV2新增了36,000条任务级人工标注,其中美学质量标注16,200条、美学标签标注13,200条、生成质量标注6,600条,相比VGA-Bench分别实现了13.46倍、11.15倍和1.55倍的扩展。更充足的“人类偏好”数据,让评估器与人的审美判断对齐得更准。

第二,评估器架构升级。 团队设计了混合架构:VAQA-Net负责连续美学评分,VTag-Net和VGQA-Net基于Qwen大视觉语言模型进行标签识别和质量评估。大模型的引入,让评估器对复杂视觉语义的理解上了一个台阶。实验结果表明,其在多个生成模型上的评估结果与人类判断高度一致。

第三,从“评估”到“优化”的闭环打通。 这是VGA-BenchV2最具突破性的设计:它将学到的美学评估器作为奖励信号,直接用于强化学习的生成模型微调。这意味着评估基准不再只是“裁判员”,它给出的分数可以直接转化为优化信号,指导生成模型在美学质量上持续迭代。

VGA-Bench到VGA-BenchV2,评估体系不再是静态的标尺,而是与生成生态“共进化”的活系统。对于蚂蚁集团的内容理解、安全审核、推荐优化等场景而言,视频质量评估能力不仅能跟上AIGC生态的演进,还能反过来驱动上游模型的优化:从“打分”到“优化”,闭环就此形成。

动态适应:工业界AI研究的独特价值

四篇论文分别从无监督学习、强化学习、黑盒优化和多模态评估四个方向切入,共同指向了同一个技术路径——从静态到动态的范式转换。实验数据也印证了这条路径的有效性:MSRGC-Net在15项指标中拿下12个第一、2个第二;ROAD在多类离线到在线强化学习任务中超越现有策略;DSEBO在千维优化问题上实现了可量化的改进;VGA-BenchV2在多个生成模型上的评估结果与人类判断高度一致。

顺着这条技术路径再看蚂蚁的整体布局,会发现一个清晰的“双轮驱动”结构:一面在金融核心场景中深耕时序建模、强化学习和优化算法;一面在数字生活与内容生态中前瞻布局多模态理解与评估基础设施。

说到底,算法再聪明,终归要回到动态的环境中检验。这四篇论文的真正价值,或许正在于它们都生长在真实的业务土壤里:蚂蚁的业务场景不是论文的“背景板”,而是问题的来源、数据的产地和效果的检验场。而这或许,正是工业界做AI研究最独特的地方——他们不只是在“做论文”,更是在为真实世界的问题,找“能抗住动态变化”的解法。