蚂蚁集团 IJCAI 2026 四篇论文:让 AI 学会「随机应变」
IJCAI-ECAI 2026 将于 8 月在德国不来梅举行。蚂蚁集团入选的四篇论文,覆盖无监督学习、强化学习、黑盒优化与多模态评估四个方向,却指向同一个技术判断:当真实世界从不是静态的,AI 就必须从「静态求解器」进化为「动态自适应者」。
IJCAI-ECAI 2026 将于 8 月在德国不来梅举行。蚂蚁集团入选的四篇论文,覆盖无监督学习、强化学习、黑盒优化与多模态评估四个方向,却指向同一个技术判断:当真实世界从不是静态的,AI 就必须从「静态求解器」进化为「动态自适应者」。
算法模型的精度在实验室里不断刷新纪录,但一旦部署到真实世界,性能衰减几乎成为常态。原因很简单:真实世界从来不是静止的。
蚂蚁集团的业务场景,将这种「不静止」推向了极致——超 10 亿用户、8000 多种服务,支付洪峰与凌晨低谷之间可以差出几个数量级,风控模型必须以小时级响应黑产策略的迭代,全球化部署还要适配各国迥异的金融基础设施。
在这样的环境里,「一次训练、永久部署」的静态模型,注定陷入「刻舟求剑」的困境。
这四篇论文,不约而同地回答了一个核心命题:如何让 AI 从「静态的求解器」进化为「动态的自适应者」?
一次训练,永久部署。无法感知环境变化,面对分布偏移时性能断崖式下跌,需要人工频繁干预调参。
算法能感知环境变化,主动调整自身策略,在动态中寻找最优解。从「预设参数」走向「实时决策变量」。
四篇论文分别从不同技术方向切入,但共享同一个底层逻辑:让算法在运行过程中自主感知环境变化并调整策略。
时间序列聚类,是把海量行为序列自动归类,理解行为模式、监控异常信号的基础工具。但现有方法各有各的尴尬:相似度方法能抓局部模式却跑不动大数据量;深度学习方法表征能力强但训练贵、调参烦;传统特征提取依赖人工设计,关键时间动态信息可能被丢掉。
更关键的是,它避开了 O(n²) 的成对计算,实现了近线性的复杂度。在蚂蚁的实际业务中,这意味着系统能根据流量密度自动调整聚类粒度——高峰时精细分群抓异常,低谷时粗粒度概括省算力,始终跟着数据走。
强化学习有个著名的「水土不服」问题——分布偏移:在离线数据上训练好的模型,一上线就容易「失忆」。现有办法要么固定 50% 离线 + 50% 在线的混合比例,要么用启发式规则优先采样「近策略」样本。
但问题是,策略在不同阶段的需求完全不一样。早期需要更多离线数据稳住基本盘,后期需要更多在线数据探索新可能。固定策略,就是刻舟求剑。
注:柱形自 55 分起缩放,非零起点。ROAD+PEX 在 D4RL 基准的 24 个连续控制任务中 18 个排第一,总体平均分 71.12。
ROAD 的核心思想是把数据混合比例从一个「预设参数」变成了「动态决策变量」。通过双层优化框架,内层做标准 Q 学习更新,外层将混合策略视为元决策变量,以最大化预期回报为目标。两层通过多臂老虎机近似求解,使得混合策略能够在训练过程中实时调整——发现模型开始「遗忘」离线知识时自动调高离线数据比例,趋于保守时又及时增加在线数据占比。
贝叶斯优化是黑盒函数优化的经典方法,但一碰到高维问题就头疼。随机嵌入是一种常见解法——把优化投射到低维子空间,但有效维度到底是多少?传统方法要么依赖专家经验给定固定子空间维度,要么通过试错法反复估计。
更大的麻烦在于:有效维度本身可能随优化进程变化——初期探索时低维度就够用,后期精调时可能需要更高维度的细节。
DSEBO 让子空间维度成为优化进程中的「动态变量」,随搜索进度自主切换。
从低维子空间出发,优化器生成候选解,经随机嵌入映射至原始空间,快速摸清目标函数的大致轮廓。
观察到收敛后自动触发维度扩展,通过共享嵌入矩阵把低维解「继承」到高维。扩展幅度根据当前最优值变化曲线自适应调整:曲线平缓就慢点扩,曲线陡峭就快点扩。
新子空间初始化和继续优化,形成「低维探索→收敛触发→维度扩展→继续优化」的循环,直到达到评估预算上限。
实验结果是:在合成函数(Levy、Griewank、Sphere,D=1000)和三个真实任务(MSLR、Lasso-Hard、LIMO)上,与 REMBO、SIRBO、BAxUS、TuRBO 等十几种主流方法逐一对比,几乎所有任务上都拿下了最优解——精度和收敛速度双双领先。
AIGC 让视频生产大爆发,但一个核心问题卡住了:我们怎么系统性评估这些生成视频的质量?传统指标主要看画面清不清晰、动作连不连贯、文本对不对得上——至于构图精不精妙、光影讲不讲究、色彩和不和谐,这些关乎「美感」的感知品质,它们几乎无能为力。
此前 CVPR 2026 上,蚂蚁联合北京电影学院、通用人工智能研究院提出了 VGA-Bench,首次为视频审美评估建立了三维度框架。但视频生成模型进化太快,以月为单位的迭代节奏让固定基准很快就「不够用了」。VGA-BenchV2 的核心进化,是把评估体系从静态标尺变成了与生成生态「共进化」的活系统。
VGA-BenchV2 新增 36,000 条任务级人工标注,让评估器与人的审美判断对齐得更准。同时引入大视觉语言模型架构,对复杂视觉语义的理解上了一个台阶。
最具突破性的设计是:它将学到的美学评估器作为奖励信号,直接用于强化学习的生成模型微调。评估基准不再只是「裁判员」,它给出的分数可以直接转化为优化信号,指导生成模型在美学质量上持续迭代——从「打分」到「优化」,闭环就此形成。
答案不复杂:蚂蚁的业务场景本身就是「动态自适应」最好的试验场。超 10 亿用户的支付行为、8000 多种服务的调度、以小时级迭代的黑产攻防——这些场景逼迫算法必须学会「随机应变」,而不是在实验室里刷分。
四篇论文分别从四个方向切入,但共享同一个底层逻辑:
顺着这条技术路径再看蚂蚁的整体布局,会发现一个清晰的「双轮驱动」结构:一面在金融核心场景中深耕时序建模、强化学习和优化算法;一面在数字生活与内容生态中前瞻布局多模态理解与评估基础设施。
算法再聪明,终归要回到动态的环境中检验。这四篇论文的真正价值,或许正在于它们都生长在真实的业务土壤里——蚂蚁的业务场景不是论文的「背景板」,而是问题的来源、数据的产地和效果的检验场。
当参数竞赛触及天花板,系统性工程能力与业务场景的深度耦合,正在成为 AI 研究真正的护城河。「自适应」不是一种算法技巧,而是一种研究范式——从静态到动态的转换,比任何单点突破都更具长期价值。
四篇论文,四个方向,一个共同的技术判断。
IJCAI-ECAI 2026 即将在德国不来梅召开,「自适应」是否会成为本届大会的关键词之一?