AFAC2026金融AI大赛落幕:四道赛题折射行业真实挑战
四届赛事,一场越来越“真”的考试
八月末的上海,近两万名选手、5027支队伍参与的AFAC金融智能创新大赛(AFAC2026)迎来总决赛。这已是该赛事举办的第四年。从2023年首届至今,参赛者累计超6万人,覆盖600多所高校和700余家企业。主办方阵容包括上海市科委、中国计算机学会、北京大学、蚂蚁集团、中国银行等30余家机构。

与其他算法竞赛不同,AFAC的核心逻辑是:把金融产业正在面对的真实问题直接搬进赛场。今年的四道赛题,分别对应二级市场行为识别、复杂文档结构还原、资源受限下的自动化实验设计,以及长文本Agent的记忆管理——每一项都踩在当前金融AI落地的关键瓶颈上。

比赛不再只是刷指标。评审标准更关注方案能否在动态变化、反馈稀疏、成本受限的条件下持续有效。用中科大教授王超的话说,关键看三点:复现、解释、泛化。一次高分可能是运气,但能讲清逻辑、经得起条件变化考验的系统,才算真正可用。

赛题一:从L2行情里“看懂”谁在买卖

第一道题要求选手从Level 2行情数据中识别市场参与者的交易行为并追踪资金流向。这看似是传统量化领域的老问题,但在大模型时代有了新难点。

数据规模变大了,形态更多样——订单流、逐笔成交、盘口快照交织在一起;评价标准也不再单一。其中一个子任务甚至没有预设指标,选手得自己定义问题边界、构建评估框架。更棘手的是,模型训练依赖静态历史数据,但真实市场永远在变。如何让系统具备迁移和泛化能力,成了胜负手。

有团队尝试用图神经网络建模订单关联,也有队伍引入时序注意力机制捕捉主力资金痕迹。但最终胜出的方案,往往不是技术最炫的,而是对市场微观结构理解最深、逻辑链条最清晰的那一类。一位评委提到,有些队伍连“撤单是否算作真实意图”都没厘清,模型再强也跑偏。

赛题二:让AI真正“读懂”财报和合同

第二道题聚焦复杂金融文档的结构化还原。OCR能识别字符,但离“理解”还很远。真正的难点在于超长表格、跨页合并单元格、非固定模板的合同条款。

复旦大学张军平教授指出,多数大模型处理不了整张复杂表格,需要分块识别再后处理拼接。而金融文档恰恰没有统一格式——今天是一家券商的研报,明天是跨境并购协议,模型能否稳定应对这种变化,直接决定它能不能进生产环境。

不少选手仍依赖人工规则补位,比如预设表格行列逻辑。但评审更看重能否把人的先验知识转化为可学习的机器能力。有团队尝试用视觉+文本多模态建模,通过坐标信息辅助结构重建;也有队伍设计层级解析器,先定位标题区块,再递归拆解子表。这些探索指向同一个方向:金融文档智能不能只靠Prompt工程,必须深入底层表示。

赛题三与四:在资源限制下做决策

后两道题共同指向一个现实:AI是有成本的。

赛题三模拟科研场景,要求Agent在预算有限、无法并行实验的情况下,自主设计实验流程并根据稀疏反馈迭代优化。蚂蚁集团陈召群解释,这其实是在测试Agent的“科研素养”——能否像人类研究员一样,在信息不全时做出合理假设,并高效验证。

赛题四则直面长上下文热潮背后的隐忧。百万Token窗口看似解决了信息容量问题,但机构级调用时,盲目塞入全文会迅速推高成本,且效果未必更好。哈工大张宇教授强调,关键不是窗口多大,而是系统能否智能筛选有效上下文。

有队伍尝试动态记忆压缩,只保留与当前问题相关的段落;也有方案引入检索增强,先粗筛再精读。这些策略背后是同一个认知转变:在金融场景,Token消耗直接对应真金白银的成本。徐万青对比互联网时代指出,AI的边际成本不会趋近于零,“每增加一个用户,就多一份Token账单”。

从赛题到生态:为什么AFAC难以复制

四届赛题串起来,就是一条清晰的技术演进线:2023年问“大模型能不能进金融”,2024年转向“怎么接进业务”,2025年关注“推理是否可靠”,2026年则聚焦“系统能否在约束下持续运行”。
今年赛事同步开源了“AFAC百万金融智能数据集”,沉淀了2023–2025年14道赛题的13万条评测样本、2000多份专业文档和130多个优胜方案。数据形态从单模态走向多模态,能力要求从预测精度升级到复杂推理,应用模式也从单点微调扩展到端到端智能系统。
但比数据更难复制的,是AFAC搭建的生态闭环。赛场之外,大赛提供算力支持、大厂直通机会、6个月加速计划,并联动WAIC、外滩大会等平台。总决赛现场的“会、展、赛”三位一体设计,让学术界、产业方和资本能直接对接——初创组团队路演后,当场就有VC约谈,HR发offer。
新加坡SGInnovate的Jae Annie Tay观察到,小团队特别需要这样的外部支持网络。而AFAC的独特之处在于,一端连着真实金融业务场景,另一端接住创新想法,中间用赛事作为转化枢纽。这种能力,只有长期深耕金融AI的产业方才能构建。
真问题,才是试金石
热闹的路演、丰厚的奖金、密集的媒体曝光,这些都可能被模仿。但AFAC的核心竞争力,在于它每年都能快速捕捉技术浪潮退去后留下的“真问题”,并将其转化为可评测的赛题。
当行业还在热议Agent概念时,AFAC已经考上下文控制;当大家追捧长上下文时,它已开始算Token成本账。这种贴近业务的敏锐度,源于蚂蚁等发起方对金融场景的深度理解。
比赛终会结束,但那些在动态环境、资源约束、鲁棒性要求下锤炼出的方案,才真正具备走向产业化的潜力。AFAC的意义,或许不在于选出冠军,而在于为整个金融AI领域划出一条从实验室到真实世界的路径。