蚂蚁百灵发布金融增强模型Ling-3.0-flash-Fin,瞄准真实投研工作流
蚂蚁百灵推首个金融增强模型,不再只“回答问题”
2026年9月,蚂蚁集团在筹备外滩大会期间,正式开源了其百灵系列的首个金融增强模型——Ling-3.0-flash-Fin。与市面上多数聚焦于问答、摘要等单点任务的金融大模型不同,这个新模型的目标更具体:让AI真正参与一项完整的投资研究工作。

换句话说,它不只是告诉你“某公司去年净利润是多少”,而是能从海量财报、公告、监管文件中找出数据,核对统计口径,做多步计算,搭建估值模型,最后输出一份结构清晰、可被专业人士审核的研究草稿。整个过程模拟的是分析师日常的工作流,而非一次孤立的查询。
目前,Ling-3.0-flash-Fin的模型权重已开放下载,API也向开发者提供体验。蚂蚁百灵团队表示,这不仅是发布一个行业模型,更是尝试构建一套“模型+工具+评测”的闭环体系,推动金融AI从演示走向实际应用。
投研不是问答,而是一条长链条
金融领域的AI落地一直是个难题。表面看,它需要处理大量结构化数据(如财务报表)和非结构化文本(如年报、新闻、监管函件);深层看,它要求极高的准确性、可追溯性和逻辑严谨性。
举个例子:要评估一家新能源车企的盈利能力,AI不能只抓取“净利润”数字就完事。它得确认数据来自哪份财报(是Q3还是全年?是否经审计?),对比不同季度的口径是否一致,剔除一次性收益的影响,再结合行业平均毛利率、资本开支趋势做横向比较。最后,这些分析还要能被人类分析师复核、修改甚至推翻。
Ling-3.0-flash-Fin正是针对这条长链条设计的。它基于Ling-3.0-flash底座,保留124B总参数、5.1B激活参数的配置,并支持256K长上下文,确保能同时处理多份年报或跨年度数据。更重要的是,模型经过专门的金融语料预训练和后训练,强化了对Excel表格、财务附注、脚注引用等复杂格式的理解能力。
四项核心能力,对应真实工作环节
蚂蚁将Ling-3.0-flash-Fin的能力拆解为四个关键环节,恰好对应投研人员的典型工作流:
- 信息检索:优先定位官方信源(如交易所公告、公司官网),并标注信息发布时间和统计口径。例如,区分“未经审计的业绩预告”和“经审计的年报”。
- 研究推理:通过多步逻辑推导,交叉验证不同来源的数据。比如,用现金流量表反推利润质量,或通过关联交易披露判断收入真实性。
- 估值建模:直接操作类Excel工作簿,支持公式切换(如从DCF切换到EV/EBITDA)、跨表引用(如将资产负债表数据链接到现金流预测),还能识别异常值并提示排查。
- 研报撰写:将上述分析结果组织成结构化文本,包含数据引用、假设说明和结论推导,输出格式便于后续人工编辑或嵌入现有报告模板。
这四项能力并非独立模块,而是被整合进一个连贯的任务流中。模型在执行时会动态调用工具(如PDF解析器、表格计算器、搜索引擎),并在每一步保留推理痕迹,确保最终产出可追溯、可复核。
不只比模型,还要有“评分尺”
光有模型还不够。金融AI到底做得好不好,过去缺乏统一标准。为此,蚂蚁同步推出了FinFIRST(Financial Information Retrieval, Sourcing and Traceability)评测基准。
FinFIRST由蚂蚁主导开发,中金公司投行团队提供专业支持,并有50多位一线金融从业者参与题目设计。它的核心理念是:一个合格的金融Agent不仅要给出正确答案,还得说清楚三件事——信息从哪来、口径是什么、结论怎么推出来的。
在数据构成上,FinFIRST覆盖中国内地、美国、中国香港等主要市场,中文题占60.2%,英文题占39.8%。超过80%的题目包含多个子问题,61.8%要求显式计算(如“计算自由现金流”),32.5%需整合多个信源,75.6%不直接指定数据来源,考验Agent的自主搜索与判断能力。所有题目均限定使用公开可访问的信源,避免依赖内部数据库。
这套评测不是为了排个名次,而是试图把金融研究中的专业判断转化为可量化、可复现的指标。目前,Ling-3.0-flash-Fin已在FinFIRST、FinSearchComp Verified、Finance Agent等多个金融智能体基准上测试,在同尺寸模型中表现突出,部分指标甚至超过更大规模的旗舰模型。
开放的不只是模型,更是验证机制
值得注意的是,蚂蚁此次采取了“模型+工具+评测”三位一体的开放策略。除了发布Ling-3.0-flash-Fin的权重和API,FinFIRST的评测集、评分脚本和基线方法也一并开源。
这种做法降低了金融机构、研究团队和独立开发者参与金融AI研发的门槛。以往,很多团队想验证自己的Agent效果,但苦于没有贴近真实场景的测试题。现在,他们可以直接用FinFIRST作为标尺,快速迭代模型或工具链。
反过来,外部反馈也能帮助蚂蚁持续优化模型。比如,某券商在使用过程中发现模型对港股通规则理解有偏差,这类真实业务问题可以成为下一轮训练的重点。
从投研出发,但不止于投研
虽然当前聚焦投资研究,但蚂蚁百灵的野心显然更大。金融只是其探索“真实世界AI”的第一个切口。团队透露,未来会基于更大规模的底座模型,进一步提升长链路复杂任务的处理能力,并将场景拓展至风险管理、资产配置、合规审查等更多金融业务领域。
更深层的趋势是,AI的价值正从“生成内容”转向“承担工作”。在医疗、法律、企业服务等专业领域,模型能否真正嵌入工作流程,取决于它是否理解行业规则、能否调用专业工具、是否产出可被人类信任和复用的结果。
Ling-3.0-flash-Fin的尝试表明,大模型要走向生产力,光有参数和数据不够,还得有对具体工作流的深刻理解,以及配套的验证机制。从“回答一个问题”到“完成一项工作”,这或许才是下一阶段AI落地的关键分水岭。