模型自己早知道答案对错,读取内部状态只需0.06秒且不花token
模型早就知道自己答得对不对
问一个大语言模型“你有多确定这个答案?”,它通常会返回0.5——相当于抛硬币。这个结果来自对2018个问题的测试,平均置信度正好卡在随机水平。
但如果你不去问它,而是直接读取它内部的隐藏状态,同样的模型、同样的问题,准确率能跳到0.8801。答案的对错其实在模型输出文字前就已经决定了,只是没人去读。
Zero-Token Confidence(ZTC)干的就是这件事:只做一次前向传播,不生成任何token,直接从模型最后一层隐藏向量里榨出一个校准过的概率。整个方案今天已在Hugging Face上线,核心文件只有45KB。
在验证器排行榜上登顶
FINAL-Bench搞了个统一评测,用2018个样本、同一套数据加载器,把市面上的验证器拉出来同场竞技。结果很有意思:
- ZTC搭配Darwin-397B模型,AUC达到0.7394,排名第一
- 另一个ZTC-Judge-27B版本也拿到0.7255,排第三
- 而模型自己报告的置信度,稳稳停在0.5000
更扎心的是,有个基线模型只看回答长度和格式(完全不读内容),AUC都有0.7036。结果有两个公开发表的验证器分数比这还低——等于说它们根本没在理解回答内容。
ZTC的优势在于,它压根不生成文字。传统验证器要让模型再写一段解释或打分,这本身就要消耗token和时间。ZTC绕过这一步,直接从计算中间结果里提取信号。
比“问模型”准得多
在539个预留测试题上,让模型自己评判自己的回答:
- Darwin-397B如果被问“你确定吗?”,准确率是0.7646
- 但用ZTC读它的隐藏状态,准确率升到0.8801,提升0.116
- Qwen3.5-27B的提升更夸张,从0.6141跳到0.8388,差了0.225
这些数字不是偶然。研究人员做了200次置换检验(把标签打乱重训探针),真实分数比随机分布高出9到13个标准差,统计显著性拉满。
即使在最严苛的“留一领域外”测试下(训练时完全没见过测试领域的数据,所有超参都在训练域内选定),Darwin-397B的ZTC得分仍有0.7572,说明泛化能力靠谱。
速度优势巨大
在四块B200显卡上测27B模型处理2000个样本:
- 生成一个候选回答要1.631秒
- ZTC门控判断只要0.0615秒——便宜26倍
Darwin-397B跑完全部2018项用了270秒(八块B200),单次0.13秒包含前向传播。这意味着你可以给每个动作都加上门控,而不是像以前那样因为成本太高只能抽检。
大模型不一定更好
有意思的是,参数量更大的模型在ZTC任务上反而表现更差。同样400个样本、同样评测设置:
- Darwin-397B-ZTC:AUC 0.8228
- Qwen3.5-27B:0.8171
- Qwen3.8-Flash-Next(180B级别):0.7146,垫底
研究者分析,Qwen3.8有48层,但其中36层用了线性注意力(linear attention),而且隐藏层宽度只有2560。ZTC探针只读一个向量,如果隐藏状态太窄,或者注意力机制压缩掉了全局比较信息,判断质量就会下降。
关键指标其实是隐藏层宽度和完整注意力层的比例,而不是总参数量。选门控模型时得看这两个,别被参数数字忽悠。
四行代码就能集成
FINAL-Bench/Darwin-397B-ZTC仓库里有个45KB的.npz文件,包含权重向量、标准化参数和校准常数。不用训练数据,不依赖额外库,四行Python搞定:
z = np.load("ztc/ztc_probe_darwin397b.npz")
h = model.model(**inputs).last_hidden_state[0, -1].float().cpu().numpy()
s = ((h - z["mu"]) / z["sd"]) @ z["w"]
p = 1 / (1 + np.exp(-(z["cal_A"] * (s - z["s_mean"]) / z["s_std"] + z["cal_B"])))FINAL-Bench/ZTC-Judge-27B则是通用版,能判断其他模型的回答,覆盖五个领域。
浏览器里实测对比
他们还做了个在线小游戏“Gate Tetris”:三条通道同时接收相同的待执行动作(比如“删三行数据”“扣款”“跑部署脚本”),但门控策略不同:
- 无门控:全执行
- 文本验证器:让模型生成判断
- ZTC:读隐藏状态
每轮正确+1,错误-1,暂停0分。400轮下来:
- 无门控:-3.9
- 文本验证器:+13.0
- ZTC:+29.1(赢了98%的对局)
ZTC把执行准确率从49%拉到65%,而且在相同300秒内处理的动作数量是文本验证器的2.2倍——因为门控几乎不花钱。
游戏里你会看到模型自报的置信度,现在你知道那基本等于噪音。
获取方式
- Darwin-397B-ZTC:397B MoE模型,自带自读探针,GPQA Diamond得分93.43
- ZTC-Judge-27B:通用判断器,支持五领域
- Gate Arcade:在线对比演示
这套方案由VIDRAFT开发,属于FINAL-Bench项目的一部分。