模型自己早知道答案对错,读取内部状态只需0.06秒且不花token

0 阅读

模型早就知道自己答得对不对

问一个大语言模型“你有多确定这个答案?”,它通常会返回0.5——相当于抛硬币。这个结果来自对2018个问题的测试,平均置信度正好卡在随机水平。

但如果你不去问它,而是直接读取它内部的隐藏状态,同样的模型、同样的问题,准确率能跳到0.8801。答案的对错其实在模型输出文字前就已经决定了,只是没人去读。

Zero-Token Confidence(ZTC)干的就是这件事:只做一次前向传播,不生成任何token,直接从模型最后一层隐藏向量里榨出一个校准过的概率。整个方案今天已在Hugging Face上线,核心文件只有45KB。

在验证器排行榜上登顶

FINAL-Bench搞了个统一评测,用2018个样本、同一套数据加载器,把市面上的验证器拉出来同场竞技。结果很有意思:

  • ZTC搭配Darwin-397B模型,AUC达到0.7394,排名第一
  • 另一个ZTC-Judge-27B版本也拿到0.7255,排第三
  • 而模型自己报告的置信度,稳稳停在0.5000

更扎心的是,有个基线模型只看回答长度和格式(完全不读内容),AUC都有0.7036。结果有两个公开发表的验证器分数比这还低——等于说它们根本没在理解回答内容。

ZTC的优势在于,它压根不生成文字。传统验证器要让模型再写一段解释或打分,这本身就要消耗token和时间。ZTC绕过这一步,直接从计算中间结果里提取信号。

比“问模型”准得多

在539个预留测试题上,让模型自己评判自己的回答:

  • Darwin-397B如果被问“你确定吗?”,准确率是0.7646
  • 但用ZTC读它的隐藏状态,准确率升到0.8801,提升0.116
  • Qwen3.5-27B的提升更夸张,从0.6141跳到0.8388,差了0.225

这些数字不是偶然。研究人员做了200次置换检验(把标签打乱重训探针),真实分数比随机分布高出9到13个标准差,统计显著性拉满。

即使在最严苛的“留一领域外”测试下(训练时完全没见过测试领域的数据,所有超参都在训练域内选定),Darwin-397B的ZTC得分仍有0.7572,说明泛化能力靠谱。

速度优势巨大

在四块B200显卡上测27B模型处理2000个样本:

  • 生成一个候选回答要1.631秒
  • ZTC门控判断只要0.0615秒——便宜26倍

Darwin-397B跑完全部2018项用了270秒(八块B200),单次0.13秒包含前向传播。这意味着你可以给每个动作都加上门控,而不是像以前那样因为成本太高只能抽检。

大模型不一定更好

有意思的是,参数量更大的模型在ZTC任务上反而表现更差。同样400个样本、同样评测设置:

  • Darwin-397B-ZTC:AUC 0.8228
  • Qwen3.5-27B:0.8171
  • Qwen3.8-Flash-Next(180B级别):0.7146,垫底

研究者分析,Qwen3.8有48层,但其中36层用了线性注意力(linear attention),而且隐藏层宽度只有2560。ZTC探针只读一个向量,如果隐藏状态太窄,或者注意力机制压缩掉了全局比较信息,判断质量就会下降。

关键指标其实是隐藏层宽度完整注意力层的比例,而不是总参数量。选门控模型时得看这两个,别被参数数字忽悠。

四行代码就能集成

FINAL-Bench/Darwin-397B-ZTC仓库里有个45KB的.npz文件,包含权重向量、标准化参数和校准常数。不用训练数据,不依赖额外库,四行Python搞定:

z = np.load("ztc/ztc_probe_darwin397b.npz")
h = model.model(**inputs).last_hidden_state[0, -1].float().cpu().numpy()
s = ((h - z["mu"]) / z["sd"]) @ z["w"]
p = 1 / (1 + np.exp(-(z["cal_A"] * (s - z["s_mean"]) / z["s_std"] + z["cal_B"])))

FINAL-Bench/ZTC-Judge-27B则是通用版,能判断其他模型的回答,覆盖五个领域。

浏览器里实测对比

他们还做了个在线小游戏“Gate Tetris”:三条通道同时接收相同的待执行动作(比如“删三行数据”“扣款”“跑部署脚本”),但门控策略不同:

  • 无门控:全执行
  • 文本验证器:让模型生成判断
  • ZTC:读隐藏状态

每轮正确+1,错误-1,暂停0分。400轮下来:

  • 无门控:-3.9
  • 文本验证器:+13.0
  • ZTC:+29.1(赢了98%的对局)

ZTC把执行准确率从49%拉到65%,而且在相同300秒内处理的动作数量是文本验证器的2.2倍——因为门控几乎不花钱。

游戏里你会看到模型自报的置信度,现在你知道那基本等于噪音。

获取方式

这套方案由VIDRAFT开发,属于FINAL-Bench项目的一部分。