AQuA系统如何解决量化研究中的数据泄漏与过拟合陷阱?

1 阅读

在量化金融领域,一条平滑上升的回测曲线往往不是胜利的号角,而是警惕的起点。经验丰富的研究员第一反应通常是质疑:是否存在未来信息泄露?测试集是否被反复窥探?收益是否仅由某段特殊市场行情驱动?这种近乎本能的怀疑,源于一个朴素而深刻的认知——生成一个看似优异的结果并不困难,真正困难的是证明这个结果值得信赖。

当人工智能代理(Agent)开始自主提出假设、执行实验,并依据结果决定下一步研究方向时,这一挑战被急剧放大。一次未被察觉的数据泄漏,可能被系统误认为是有效发现而存入“记忆”;从此,Agent并非在持续进步,而是在错误结论的轨道上越走越远,形成自我强化的幻觉循环。

针对这一核心难题,普林斯顿大学、蚂蚁集团与斯坦福大学的研究团队在论文《AQuA: Recursively Self-Improving Quantitative Trading Research Agents》中提出了一套全新的研究架构。AQuA并非追求更强大的模型或更复杂的推理链,而是从根本上重构了自主研究的信任机制。

实验作为证据:构建可追溯的研究记忆

AQuA的核心理念在于“递归自改进”(recursive self-improvement)发生在研究过程层面,而非模型权重层面。每一次实验不仅是对某个假设的检验,更是为下一轮研究提供结构化证据的过程。

在传统自动化研究中,Agent可能仅记录最终指标如IC或Sharpe比率。而AQuA要求保存完整的实验上下文:假设的经济逻辑、预测方向、证伪条件、与基线的对比结果、适用的市场状态,以及推翻初始判断的关键证据。这些信息共同构成“研究记忆”,成为后续探索的起点。

例如,一个方向判断错误但仍有预测力的信号,可在校准后保留;仅在特定事件中有效的因子,则带着明确的适用边界进入记忆库;而多次失败的机制,即使换一种表述也不会轻易重现。这种机制避免了无效探索的重复浪费,也防止了错误结论的伪装再生。

值得注意的是,AQuA刻意将“研究方向的调整”与“评价标准的变更”解耦。Agent可以根据历史实验调整策略,但不能修改数据划分、特征定义或评分规则。评价体系作为外部锚点保持稳定,确保所有改进都建立在一致的可信基准之上。

从一次真实失败中倒推的系统设计

AQuA当前的受限架构并非理论推演的结果,而是源于一次真实的早期失败。在初始版本中,Agent可自由编写特征代码,另一审查Agent负责检查前视偏差。

一个名为“盘中成交量参与率”的特征被提出:即从开盘至当前时刻的累计成交量占当日总成交量的比例。从语义上看,它似乎仅依赖已发生数据,审查Agent予以放行。然而,代码实现中分母使用的是全天实际成交量——这意味着在中午计算时,下午尚未发生的交易已被纳入分母。

这一隐蔽的数据泄漏导致该特征在held-out验证集上表现出异常高的IC。但当重新划分时间窗口后,效果完全消失。研究人员通过追踪数据依赖链才定位到问题根源。

更值得警惕的是,两个Agent均未发现问题。它们对特征的经济含义理解一致,都认为其符合因果性,却忽略了程序实际访问的时间戳细节。这一事故揭示了一个关键洞见:语义合理性无法替代对数据路径的硬性约束。

由此,团队彻底放弃了依赖Agent自我审查的思路。新架构中,Agent不再能任意编写代码,而是只能在预注册的因果算子和模型组件库中进行组合。例如,“当日总成交量”字段根本不在可用数据集中,上述问题特征自然无法生成。这种“权限前置”的设计,将可靠性内嵌于系统结构,而非寄托于每次推理的正确性。

双重隔离:阻断两类泄漏路径

量化研究中的可信度威胁主要来自两个维度:生成过程污染与选择过程过拟合。AQuA通过双重隔离机制分别应对。

第一重隔离:生成过程的因果约束。在研究循环启动前,系统即固定数据切分、特征空间、标签定义及评价器。Part I(因子发现)仅允许组合预登记的时间序列与截面算子;Part II(模型研发)仅允许提交配置差分(如修改损失函数、优化器或采样策略)。Agent可选择研究方案,但无法改写数据加载逻辑或评价规则。

第二重隔离:选择过程的测试集保护。搜索阶段仅向Agent返回预设验证集的分数,用于候选排序与早停决策。最终测试窗口(如2021–2025年)在配置完全确定后才运行,且结果不反馈给Agent用于进一步调参。中间还设置隔离带(如2020年),防止信息通过时间邻近性间接泄露。

这两类隔离缺一不可。一个完全因果的模型,若反复查看测试成绩,仍会过拟合;一个从未见过测试集的Agent,也可能在特征构造中无意引入未来信息。AQuA将可信度锚定于环境设计本身——通过权限控制、数据血缘追踪和运行日志,实现可审计的研究流程。

两套独立系统,验证同一研究范式

AQuA包含两个并行但独立的子系统:Part I专注于符号化因子发现,Part II聚焦可训练模型优化。这种分离并非功能割裂,而是为了在差异化的任务场景中验证同一套研究原则的普适性。

Part I采用多Agent协作架构:AI Manager调度Data Steward、Visual Analyst、Idea Miner等六个专业角色,确保从问题提出到因子入库的全过程可追溯。例如,针对“未平仓合约快速下降后的价格反弹是否更易失败”这一市场现象,系统会识别强制去杠杆事件,分析价格、成交量、基差与主动买单流的后续变化,并将观察转化为可证伪的机制。候选因子需通过多重检验:与简单基线比较、验证效果是否集中于假设事件窗口、排除与现有因子的冗余性。

经过20轮自主研究,组合验证集Spearman IC从初始的0.026–0.037提升至约0.190。这一进步并非来自某个“神奇公式”,而是多个经济机制不同、经严格检验的弱信号逐步积累的结果。

Part II则转向美股未来30分钟收益预测。每轮实验仅提交一个配置差分,明确记录改动内容(如模型结构、损失函数等)。固定的数据路径与评价器使得不同变体可直接比较,后续Agent能清晰理解性能提升的来源。

最终模型采用混合时序架构:多尺度一维卷积捕捉局部价量模式,可配置时序主干(如Attention)处理长程动态,截面模块融合股票间信息,读取层输出逐股票预测分数。在相同评价器下,该模型将逐股票IC从基线GRU的+0.0613提升至+0.0843。经行业中性化与波动率控制后,构建的美元中性多空策略在计入2 bps双边换手成本下,样本外Sharpe达+2.50,且2021–2025年每年均为正。

尽管两套系统的指标不可直接比较(0.190为加密资产组合IC,0.0843为美股单股票raw IC),但它们共同证明:“证据进入记忆、评价保持独立”的研究范式可有效迁移至不同量化任务。

重新分配信任:从逐次审查到制度设计

AQuA的深层意义在于重新定义了人在自主研究中的角色。传统模式下,研究者需逐句审查Agent的推理是否合理;而在AQuA中,人类注意力被引导至更高阶的制度设计:如何定义数据边界?哪些操作属于可接受实验?候选如何公平比较?哪些结果有资格进入下一轮?

这种转变将信任从“Agent的解释能力”转移到“研究环境的抗污染能力”。对于长期运行的系统而言,后者可通过权限、日志和审计进行客观验证,而前者难以逐次确认。

团队刻意保持Part I与Part II的独立性,也体现了对耦合风险的审慎态度。若因子库与模型训练共享状态,前一阶段筛选出的过拟合因子可能成为后一阶段的输入,形成新型泄漏。论文提出的下一步并非简单拼接两系统,而是先冻结经验证的因子库,再将其作为Part II的沙箱输入——这种渐进式整合更符合科学研究的严谨逻辑。

当然,AQuA仍有明确边界:目前仅在单一市场与预测周期验证,回测未经理盘检验,测试集隔离依赖运行权限而非密码学强制。但其核心贡献已超越具体性能数字——它回答了一个常被忽视的问题:自主研究系统的上限,不仅取决于模型有多聪明,更取决于系统能否分辨什么是新证据,什么只是偶然高分。

在AQuA中,20轮因子研究之所以能持续积累,模型架构之所以能连续改进,正是因为研究过程保留了可追溯的成功与失败,同时拒绝将评价标准交予搜索本身。那条醒目的回测曲线固然引人注目,但真正珍贵的,是曲线背后那套知道如何继续探索、也懂得何时保持怀疑的研究能力。