13个答案验证模型同场竞技:表面特征基线竟击败多数系统

0 阅读

验证模型比拼:谁真能判断LLM答案对错?

现在每个做答案验证的厂商都会发自己的榜单,然后自己排第一。为了打破这种局面,研究团队把13个系统拉到同一个测试集上跑分——2018条带标注的问答对,完全相同的评分代码,结果直接并排展示。

最终只有三个系统AUC超过0.70。更让人意外的是,一个只看答案长度、数字数量和格式的简单逻辑回归模型,得分0.7036,干掉了13个系统里的8个。这意味着不少所谓“验证模型”其实只是在识别答案的表面形状,而非事实正确性。

Typed Decision:零生成令牌的验证新范式

这次评测聚焦一类叫“typed decision model”(类型化决策模型)的系统。它和传统方法不同:不生成任何文本,只输出结构化判断——比如布尔值、选项或序数分数。因为只需一次前向传播且零生成令牌,这类模型比直接问大模型快几十到几百倍,成本也低得多。

TypeSafe AI的JEV最早提出这个概念(当时叫System One模型),后来陆续出现开源复现、架构兼容的替代品如Convai的Laya,以及Patronus Lynx、Vectara HHEM等周边工具。但此前一直缺少统一测试基准。

测试设计的关键细节

任务很明确:给定一个问题和某个模型生成的答案,判断答案是否正确。数据包含2018条样本(其中508条错误),覆盖5个领域,答案由4种不同模型生成。

用AUC作为指标——衡量错误答案能否被排到底部,无需设定阈值(0.5相当于随机猜)。特别强调两点设计:

  1. 按领域先聚合再加权平均:如果把所有数据混在一起算AUC,分数会虚高。因为不同领域分数尺度不同,混合计算会奖励这种差异而非真实判别力。实测显示混合AUC达0.80,而按领域平均仅0.73,团队选择报告后者。
  2. 包含两个基线:一个是上述表面特征模型,另一个是答题模型自己声明的置信度(得分正好0.5)。它们让其他系统有明确比较基准。

榜单结果:头部胶着,多数不及格

排名 系统 AUC
1 ZTC (397B) 0.7364
2 JEV 0.7350
3 ZTC (27B) 0.7282
表面特征基线 0.7036
4 open-jev 4B 0.6844
... ... ...
7 Laya-Multilingual 322M 0.4796

头部两名差距仅0.0014,95%置信区间为[-0.019, +0.032],包含零值——按规则视为无显著差异。而8个系统连表面基线都打不过,说明它们根本没学到事实验证能力。

作为参照,直接调用大模型生成判断(虽不属于本赛道):GPT-5.2得0.7148,Qwen3-Next-80B仅0.6366,GPT-4o-mini和Gemini Flash更是低于0.59。

四个经得起误差检验的发现

表面基线才是真实门槛

那个只看长度和格式的基线得0.7036,像一盆冷水浇醒行业:很多验证模型连这个简单策略都不如。任何不包含该基线的榜单,本质上是在纵容参赛者。

模型越大不一定越好

同系列中,397B整体略胜27B,但在科学推理子集上却惨败:27B得0.7410,397B仅0.6287。参数量14倍差距换来0.11分落后。另一组对比更明显:180B级模型0.7146,不如4B模型的0.7284。这说明验证能力取决于表征几何结构,而非单纯堆参数。

直接问大模型:贵且平庸

GPT-5.2虽以0.7148进入前三,但每次调用需生成令牌,千次成本约0.55美元;而JEV仅0.024美元。更小的裁判如GPT-4o-mini(0.5878)表现更差。花高价换来的只是中游水平。

开源替代存在但差距明显

Laya是JEV最接近的开源方案:非自回归、零生成令牌、Apache-2.0协议,单次调用约0.015秒(比托管API快140倍)。速度优势确实存在,但准确率仅0.4796/0.5144,远低于其宣称的“超越JEV”。这恰恰证明统一测试集的价值——不同榜单结果可能完全不同。

AUC高≠实际部署效果好

榜单回答了“谁更能区分对错”,但没回答“谁更能帮到你的智能体”。团队专门测试了后者:

  • 设置:用验证器给答案打分,把最低的20%送更强模型重答,其余保留。所有方案共享同一重答池(避免运气差异),200次随机种子取平均。
  • 结果:无验证门控时准确率74.83%;用ZTC提升至76.16%(+1.34个百分点);JEV反而降至74.76%(-0.07点)。

两者AUC仅差0.0014,但最终效果差1.4个百分点。原因在于重答是双刃剑:

  • 错误答案重答后,38%被修正
  • 正确答案重答后,30%被改错

因此门控价值取决于精确率而非召回率。JEV在20%预算下送了403条重答,其中216条原本正确;ZTC同样数量里只有195条原本正确。JEV修好的和搞砸的差不多,净收益几乎为零——这种不对称性在AUC里完全看不到。

(注:此结论基于单一重答目标和数据集,视为机制演示而非普适规律)

发布内容与限制

团队完整公开了所有分数、标签和评分代码,但未分发原始题目——因部分来自禁止再分发的语料库或商业模型输出。评分代码开源允许用户在私有数据上复现流程。

另有4个已发表的复现版本因技术问题未能运行(如缺失分类头、架构不支持),被明确列为“未运行”而非直接剔除。还有一个条目因复现结果与原报告偏差较大,暂时保留原分数但标记为“待验证”——团队拒绝用自己不可靠的代码拉低竞品分数。

如何参与或复现

榜单详细列出每个系统的API可用性、本地权重、是否支持客户数据微调、生成令牌数、千次调用成本及分领域AUC。任何人可通过Hugging Face Space提交可运行的评分代码来添加新系统。

完整榜单见:https://huggingface.co/spaces/mayafree/typed-decision-leaderboard

被测系统包括:Darwin-397B-ZTC、ZTC-Judge-27B、JEV、open-jev 4B、Patronus Lynx 8B、Laya系列、Vectara HHEM-2.1,以及GPT-5.2、GPT-4o-mini、Gemini 2.5 Flash-Lite、Qwen3-Next-80B等大模型裁判。

这场同台竞技揭示了一个残酷现实:在答案验证领域,精心设计的简单策略可能胜过复杂模型,而头部系统的微小AUC差异在实际应用中可能产生巨大效果分化。对开发者而言,选验证器不能只看榜单排名,更要关注其在具体场景中的精确率表现。