13个答案验证模型同场竞技:表面特征基线竟击败多数系统
验证模型比拼:谁真能判断LLM答案对错?
现在每个做答案验证的厂商都会发自己的榜单,然后自己排第一。为了打破这种局面,研究团队把13个系统拉到同一个测试集上跑分——2018条带标注的问答对,完全相同的评分代码,结果直接并排展示。
最终只有三个系统AUC超过0.70。更让人意外的是,一个只看答案长度、数字数量和格式的简单逻辑回归模型,得分0.7036,干掉了13个系统里的8个。这意味着不少所谓“验证模型”其实只是在识别答案的表面形状,而非事实正确性。
Typed Decision:零生成令牌的验证新范式
这次评测聚焦一类叫“typed decision model”(类型化决策模型)的系统。它和传统方法不同:不生成任何文本,只输出结构化判断——比如布尔值、选项或序数分数。因为只需一次前向传播且零生成令牌,这类模型比直接问大模型快几十到几百倍,成本也低得多。
TypeSafe AI的JEV最早提出这个概念(当时叫System One模型),后来陆续出现开源复现、架构兼容的替代品如Convai的Laya,以及Patronus Lynx、Vectara HHEM等周边工具。但此前一直缺少统一测试基准。
测试设计的关键细节
任务很明确:给定一个问题和某个模型生成的答案,判断答案是否正确。数据包含2018条样本(其中508条错误),覆盖5个领域,答案由4种不同模型生成。
用AUC作为指标——衡量错误答案能否被排到底部,无需设定阈值(0.5相当于随机猜)。特别强调两点设计:
- 按领域先聚合再加权平均:如果把所有数据混在一起算AUC,分数会虚高。因为不同领域分数尺度不同,混合计算会奖励这种差异而非真实判别力。实测显示混合AUC达0.80,而按领域平均仅0.73,团队选择报告后者。
- 包含两个基线:一个是上述表面特征模型,另一个是答题模型自己声明的置信度(得分正好0.5)。它们让其他系统有明确比较基准。
榜单结果:头部胶着,多数不及格
| 排名 | 系统 | AUC |
|---|---|---|
| 1 | ZTC (397B) | 0.7364 |
| 2 | JEV | 0.7350 |
| 3 | ZTC (27B) | 0.7282 |
| — | 表面特征基线 | 0.7036 |
| 4 | open-jev 4B | 0.6844 |
| ... | ... | ... |
| 7 | Laya-Multilingual 322M | 0.4796 |
头部两名差距仅0.0014,95%置信区间为[-0.019, +0.032],包含零值——按规则视为无显著差异。而8个系统连表面基线都打不过,说明它们根本没学到事实验证能力。
作为参照,直接调用大模型生成判断(虽不属于本赛道):GPT-5.2得0.7148,Qwen3-Next-80B仅0.6366,GPT-4o-mini和Gemini Flash更是低于0.59。
四个经得起误差检验的发现
表面基线才是真实门槛
那个只看长度和格式的基线得0.7036,像一盆冷水浇醒行业:很多验证模型连这个简单策略都不如。任何不包含该基线的榜单,本质上是在纵容参赛者。
模型越大不一定越好
同系列中,397B整体略胜27B,但在科学推理子集上却惨败:27B得0.7410,397B仅0.6287。参数量14倍差距换来0.11分落后。另一组对比更明显:180B级模型0.7146,不如4B模型的0.7284。这说明验证能力取决于表征几何结构,而非单纯堆参数。
直接问大模型:贵且平庸
GPT-5.2虽以0.7148进入前三,但每次调用需生成令牌,千次成本约0.55美元;而JEV仅0.024美元。更小的裁判如GPT-4o-mini(0.5878)表现更差。花高价换来的只是中游水平。
开源替代存在但差距明显
Laya是JEV最接近的开源方案:非自回归、零生成令牌、Apache-2.0协议,单次调用约0.015秒(比托管API快140倍)。速度优势确实存在,但准确率仅0.4796/0.5144,远低于其宣称的“超越JEV”。这恰恰证明统一测试集的价值——不同榜单结果可能完全不同。
AUC高≠实际部署效果好
榜单回答了“谁更能区分对错”,但没回答“谁更能帮到你的智能体”。团队专门测试了后者:
- 设置:用验证器给答案打分,把最低的20%送更强模型重答,其余保留。所有方案共享同一重答池(避免运气差异),200次随机种子取平均。
- 结果:无验证门控时准确率74.83%;用ZTC提升至76.16%(+1.34个百分点);JEV反而降至74.76%(-0.07点)。
两者AUC仅差0.0014,但最终效果差1.4个百分点。原因在于重答是双刃剑:
- 错误答案重答后,38%被修正
- 正确答案重答后,30%被改错
因此门控价值取决于精确率而非召回率。JEV在20%预算下送了403条重答,其中216条原本正确;ZTC同样数量里只有195条原本正确。JEV修好的和搞砸的差不多,净收益几乎为零——这种不对称性在AUC里完全看不到。
(注:此结论基于单一重答目标和数据集,视为机制演示而非普适规律)
发布内容与限制
团队完整公开了所有分数、标签和评分代码,但未分发原始题目——因部分来自禁止再分发的语料库或商业模型输出。评分代码开源允许用户在私有数据上复现流程。
另有4个已发表的复现版本因技术问题未能运行(如缺失分类头、架构不支持),被明确列为“未运行”而非直接剔除。还有一个条目因复现结果与原报告偏差较大,暂时保留原分数但标记为“待验证”——团队拒绝用自己不可靠的代码拉低竞品分数。
如何参与或复现
榜单详细列出每个系统的API可用性、本地权重、是否支持客户数据微调、生成令牌数、千次调用成本及分领域AUC。任何人可通过Hugging Face Space提交可运行的评分代码来添加新系统。
完整榜单见:https://huggingface.co/spaces/mayafree/typed-decision-leaderboard
被测系统包括:Darwin-397B-ZTC、ZTC-Judge-27B、JEV、open-jev 4B、Patronus Lynx 8B、Laya系列、Vectara HHEM-2.1,以及GPT-5.2、GPT-4o-mini、Gemini 2.5 Flash-Lite、Qwen3-Next-80B等大模型裁判。
这场同台竞技揭示了一个残酷现实:在答案验证领域,精心设计的简单策略可能胜过复杂模型,而头部系统的微小AUC差异在实际应用中可能产生巨大效果分化。对开发者而言,选验证器不能只看榜单排名,更要关注其在具体场景中的精确率表现。