蚂蚁集团IJCAI 2026:AI如何从静态求解进化为动态自适应者?

0 阅读

在人工智能技术飞速迭代的今天,实验室里的算法精度不断刷新纪录,但一旦部署到复杂多变的真实世界,性能衰减几乎成为常态。这背后的根本原因在于,真实世界从来不是静止的,而是一个充满不确定性、非平稳性和高动态变化的环境。对于拥有超10亿用户、涵盖8000多种服务的蚂蚁集团而言,这种动态性被推向了极致:支付洪峰与凌晨低谷的巨大落差、黑产策略的小时级迭代、全球各地迥异的金融基础设施,都要求AI系统必须具备极强的环境适应能力。

传统的“一次训练、永久部署”静态模型模式,在面对如此剧烈的环境波动时,往往陷入“刻舟求剑”的困境。因此,真正的智能不仅仅在于求解能力的强弱,更在于算法能否感知环境变化、主动调整自身策略,并在动态中寻找最优解。在IJCAI 2026大会上,蚂蚁集团入选的四篇论文不约而同地指向了这一核心命题:如何让AI从“静态的求解器”进化为“动态的自适应者”。这一技术脉络的转变,标志着工业界AI研究正从单纯追求规模效应,转向对动态环境适应能力的系统性探索。

时间序列聚类的自适应革新:MSRGC-Net

时间序列聚类是理解用户行为模式、监控异常信号的基础工具,但在实际应用中面临着巨大的挑战。现有的相似度方法如k-Shape虽然能捕捉局部模式,但在海量数据面前计算复杂度高达O(n²),难以扩展;深度学习方法如自编码器虽然表征能力强,但训练成本高且调参复杂;而传统特征提取方法则容易丢失关键的时间动态信息。更为棘手的是,现实中的时序数据密度分布极不均匀,例如双十一期间的交易数据密集如暴雨,而凌晨时段则稀疏如滴水,传统方法往往需要预先指定聚类数目,这与现实数据的动态特性严重错位。

针对这一痛点,蚂蚁集团联合重庆邮电大学提出了MSRGC-Net,通过一套“无训练”的组合拳,巧妙绕开了精准度与计算效率之间的两难选择。该模型的核心逻辑分为三个关键步骤。首先,利用多个无需训练的回声状态网络(ESN)作为储备池计算单元,仅通过调整谱半径即可从原始时序中同时提取局部波动和长期趋势,形成视图特征矩阵。其次,引入“颗粒球”锚定图构建机制,这是该算法最精妙之处。它不再关注单个数据点,而是根据数据的局部密度自动划分“颗粒球”:在高密度区域形成小而多的颗粒,在低密度区域形成大而少的颗粒。这一过程不仅将数据规模从N压缩至M(M<N),还有效抑制了噪声干扰。

最后,通过基于共识的多尺度图优化策略,跨尺度的锚定图被融合,使模型既能捕获微观局部模式,又能把握宏观全局趋势,最终生成无需人工指定聚类数目的鲁棒结果。在5个多变量基准数据集的15项评估指标中,MSRGC-Net取得了12项最优、2项第二的优异成绩,最优率高达80%。更重要的是,它实现了近线性的计算复杂度,意味着在蚂蚁的实际业务中,系统能根据流量密度自动调整聚类粒度,高峰时精细分群抓异常,低谷时粗粒度概括省算力,真正实现了跟随数据动态变化的自适应能力。

强化学习的动态平衡:ROAD算法

强化学习在从离线训练向在线部署迁移时,常面临著名的“水土不服”问题,即分布偏移导致的策略失忆。离线数据与在线交互数据之间的分布差异,使得模型在上线初期容易迅速遗忘离线阶段学到的知识。现有的解决方案通常采用固定的离线与在线数据混合比例,或依赖启发式规则采样,但这忽略了策略在不同阶段的需求差异:早期需要更多离线数据稳住基本盘,后期则需要更多在线数据探索新可能。

蚂蚁集团联合上海交通大学提出的ROAD算法,将数据混合比例从一个预设参数转变为动态决策变量。其核心思想是将数据选择视为一个双层优化问题:内层进行标准的Q学习更新以最小化贝尔曼误差,外层则将数据混合策略视为元决策变量,以最大化在线策略的预期回报为目标。通过多臂老虎机(MAB)算法近似求解,ROAD能够在训练过程中实时调整混合策略。当检测到模型开始遗忘离线知识时,自动提高离线数据采样比例;当模型趋于保守、探索不足时,则增加在线数据占比。

在AntMaze、MuJoCo和FrankaKitchen等经典基准任务上的实验显示,ROAD具有极强的普适性,能与IQL、PEX、CQL等多种主流离线算法无缝嫁接。以PEX+ROAD为例,该方法在D4RL基准的24个连续控制任务中,有18个任务排名第一,总体平均分显著优于所有基线。这种在“保守继承”与“激进探索”之间寻找动态平衡的能力,对于蚂蚁集团的风控模型上线、推荐系统实时优化等场景具有极高的应用价值,确保了模型在动态环境中既稳健又具进取性。

高维优化的自主演进:DSEBO

贝叶斯优化是黑盒函数优化的经典方法,但在处理高维问题时往往力不从心。传统的随机嵌入方法需要将优化投射到低维子空间,但有效维度的确定依赖于专家经验或试错法,且固定维度难以适配优化进程中不同阶段的需求。初期探索可能只需低维度,而后期精调则需要更高维度的细节。

蚂蚁集团联合华东师范大学、南京大学提出的DSEBO算法,让子空间维度成为优化进程中的动态变量。其核心机制遵循“从低到高,逐级跃升”的原则:从低维子空间出发,快速摸清目标函数的大致轮廓;观察到收敛后,自动触发维度扩展,通过共享嵌入矩阵将低维解继承到高维;随后在新子空间中继续优化。维度扩展的幅度并非固定,而是根据当前最优值的变化曲线自适应调整:曲线平缓时慢速扩展以节省开销,曲线陡峭时快速扩展以捕捉高维增益。

在合成函数及MSLR、Lasso-Hard等真实任务的对比实验中,DSEBO在精度和收敛速度上均领先于REMBO、SIRBO等十几种主流方法。这种“低维探路、高维精调”的策略,极大地提升了信贷模型超参数调优、风控策略阈值寻优等日常研发任务的效率,实现了从人工估计维度到算法自主适应的跨越。

评估体系的共生进化:VGA-BenchV2

如果说前三篇论文聚焦于算法层面的自适应,那么VGA-BenchV2则展示了评估基础设施如何适应AIGC技术生态的快速迭代。随着视频生成模型的爆发,传统评估指标如FVD和CLIP Score在衡量构图、光影、色彩等美学品质方面显得力不从心。此前推出的VGA-Bench首次建立了视频审美评估框架,但面对以月为单位的模型迭代节奏,固定基准很快便显滞后。

VGA-BenchV2在此基础上进行了三大核心进化。首先,大幅增加了人工标注量级,新增36,000条任务级标注,使评估器与人类审美判断的对齐更加精准。其次,升级了评估器架构,引入Qwen大视觉语言模型,提升了对复杂视觉语义的理解能力。最具突破性的是,VGA-BenchV2打通了从“评估”到“优化”的闭环,将学到的美学评估器作为奖励信号,直接用于强化学习的生成模型微调。这意味着评估基准不再仅仅是裁判,更成为了驱动上游模型优化的引擎,形成了与生成生态共进化的活系统。

综上所述,蚂蚁集团在IJCAI 2026上的成果展示了一条清晰的技术路径:从静态到动态的范式转换。无论是MSRGC-Net对数据密度的自适应,ROAD对数据分布的自适应,DSEBO对搜索空间的自适应,还是VGA-BenchV2对生态演进的自适应,都体现了工业界AI研究的独特价值——它们生长在真实的业务土壤中,旨在为真实世界的问题寻找能抗住动态变化的解法。这种双轮驱动的结构,既深耕金融核心场景,又前瞻布局数字生活生态,为AI技术在复杂动态环境中的落地提供了宝贵的实践指引。