蚂蚁发布金融增强模型Ling-3.0-flash-Fin,瞄准投研完整工作流

0 阅读

蚂蚁百灵推出首个金融增强模型,不再满足于“答对问题”

外滩大会前夕,蚂蚁集团正式开源其百灵系列首个面向金融场景的增强模型——Ling-3.0-flash-Fin。与市面上多数金融大模型聚焦于问答、摘要等单点任务不同,这个新模型的目标更进一步:让AI从“回答一个问题”转向“完成一项工作”。

具体来说,它试图打通投资研究中的完整任务链路——从找资料、验数据、做计算、建模型,到最后生成一份可被专业人士审核和复用的研究报告。这背后反映的是金融AI竞争逻辑的变化:不再比谁“知道得多”,而是看谁“干得成事”。

目前,该模型已开放权重,并提供API供开发者体验。与此同时,蚂蚁还同步开源了金融搜索Agent评测基准FinFIRST,试图为行业建立一套更贴近真实需求的“评分尺”。

为什么金融AI不能只靠“知识库问答”?

金融领域向来被视为AI落地的高难度场景。一份看似简单的研究报告,背后往往涉及大量复杂操作:

  • 从上市公司年报、监管公告、行业研报中提取关键数据;
  • 核对不同报告期、不同统计口径下的财务指标是否可比;
  • 进行多步计算,比如调整非经常性损益、重述历史数据;
  • 构建估值模型,处理跨表公式依赖和异常值排查;
  • 最终组织语言,形成逻辑严密、证据清晰的结论。

这些步骤环环相扣,任何一个环节出错,都可能导致最终结论失效。传统的大模型即便能准确回答“某公司2023年净利润是多少”,也无法保证这个数字是否经过口径调整、是否适用于当前分析场景。

Ling-3.0-flash-Fin的定位,正是要解决这种“碎片化智能”的问题。它不再把信息检索、计算、建模看作孤立任务,而是尝试将它们串联起来,形成一个可执行、可验证的工作流。

四项能力,对应一条真实投研链路

目前,该模型重点强化了四项核心能力,恰好对应投资研究的关键环节:

  1. 信息检索:优先定位官方、一手、高可信度的数据源(如交易所公告、公司官网财报),并关注信息的时间点和统计口径。例如,区分“未经审计的业绩快报”和“经审计的年报”。

  2. 研究推理:通过多步逻辑推导和交叉验证,厘清事实与假设。比如,当两份报告对同一指标给出不同数值时,模型需判断差异来源(是否因会计准则变更?是否包含子公司范围不同?)。

  3. 估值建模:直接操作真实财务工作簿,支持公式切换、跨表引用和异常排查。这意味着AI生成的模型可直接导入分析师现有Excel流程,而非仅输出静态结果。

  4. 研报撰写:在整合事实、数据和判断的基础上,生成结构清晰、可编辑、可审核的研究材料,而非堆砌信息的“AI八股文”。

这四项能力并非功能清单式的堆砌,而是围绕“完成一项研究任务”这一目标协同运作。例如,在分析一家新能源车企时,模型需先找到其最新交付数据和电池成本披露,再结合行业平均毛利率进行横向比较,接着构建DCF模型测算合理估值,最后撰写一段有数据支撑的投资建议。

不只发模型,还要定标准:FinFIRST评测体系亮相

光有模型还不够。如何判断一个金融AI到底“干得好不好”?这是行业长期缺乏共识的问题。

为此,蚂蚁同步推出了FinFIRST(Financial Information Retrieval, Sourcing and Traceability)评测基准。该体系由蚂蚁构建,中金公司投行团队提供专业支持,并有50余位金融从业者参与题目设计,覆盖中国内地、美国、中国香港等多个市场。

FinFIRST的核心理念是:好的金融AI不仅要给出正确答案,还要说清楚三件事——信息从哪里来、口径是什么、结论怎么得出的

在具体设计上,这套评测体现出几个特点:

  • 60.2%的题目为中文,贴近本土金融实践;
  • 80%以上题目包含多个子问题,模拟真实研究中的复合任务;
  • 61.8%要求显式计算,不能仅靠检索拼凑答案;
  • 32.5%需整合多个信源,考验信息交叉验证能力;
  • 75.6%不指定信源,要求Agent自主判断哪些数据可靠、何时可用。

所有题目均使用公开可访问的信源,确保结果可复现。FinFIRST不是简单的排行榜,而是一套将专业判断转化为可验证标准的工具。

模型底座与实际表现

Ling-3.0-flash-Fin基于Ling-3.0-flash打造,总参数量124B,激活参数5.1B,支持256K长上下文。这一配置兼顾了复杂金融文档的处理能力和实际部署效率。

模型通过三阶段优化提升专业能力:

  • 金融语料持续预训练:注入大量年报、招股书、监管文件等非结构化文本;
  • 领域后训练:针对财务计算、估值逻辑等任务进行指令微调;
  • 工具使用优化:强化对计算器、表格解析器、搜索引擎等外部工具的调用能力。

在FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking等多个金融智能体基准测试中,该模型综合表现超过部分更大尺寸的旗舰模型,在同参数规模下具备较强竞争力。

开放“模型+工具+评测”三位一体能力

此次发布的一个关键特点是“三位一体”的开放策略:不仅开源模型权重,还提供API接口,并同步开放评测基准。

这种做法的意义在于:

  • 降低金融AI研发门槛:金融机构和开发者无需从零构建评测体系,可直接基于FinFIRST验证自己的Agent;
  • 加速真实反馈闭环:更多业务场景的使用数据可反哺模型迭代;
  • 推动行业标准形成:通过开放协作,逐步建立金融AI的能力共识。

蚂蚁表示,金融只是其探索“真实世界AI”的一个切入点。未来,百灵将继续在更大规模模型底座上增强金融能力,并将经验拓展至风控、合规、财富管理等更多业务场景。

从“生成内容”到“承担工作”,AI生产力的新定义

过去几年,大模型的价值常被简化为“能写多少字”“能回答多难的问题”。但在专业领域,真正的生产力不在于输出量,而在于能否嵌入工作流程、承担实际任务。

金融行业的复杂性决定了,AI必须理解规则、调用工具、接受复核。Ling-3.0-flash-Fin的尝试表明,下一代专业AI的竞争,将从单点能力转向端到端工作流的完整性与可靠性。

这或许正是大模型从“炫技”走向“实干”的关键一步。