当基准测试分数变成营销话术:对 DavidAU 与 Nightmedia 模型声明的技术审计
当基准测试分数变成营销话术
在开源大模型社区,模型卡(model card)是用户判断模型能力的第一依据。理想情况下,它应提供可复现、方法透明、结论克制的评估数据。但现实中,一些热门模型卡正将有限的基准测试结果包装成宏大叙事——比如把 ARC-Challenge 分数 0.711 解读为“进入 OpenAI/Claude/Gemini 的智能区间”,或将七个旧基准的微小提升称为“最强开源微调”。
本文对 DavidAU 和 Nightmedia 发布的多个 Qwen3 系列模型卡进行了技术审计,聚焦一个核心问题:所展示的实验是否真正支持其能力声明?
七项基准的局限性
被反复使用的测试套件包括:
- ARC-Challenge / ARC-Easy
- BoolQ
- HellaSwag
- OpenBookQA
- PIQA
- WinoGrande

这些确实是合法的基准,诞生于 2018–2020 年,分别衡量阅读理解、物理常识、推理延续等窄域能力。问题不在于它们无效,而在于将其视为“通用智能”的代理指标。

这套测试全是短文本、多项选择题,完全不涉及:

- 仓库级代码生成(如 SWE-bench)
- 终端自主操作(Terminal-Bench)
- 百万 token 级长上下文检索
- 工具调用或函数调用
- 复杂数学竞赛题(如 AIME、HMMT)
- 科学推理(GPQA Diamond)

保留这套作为历史回归基线没问题,但若据此宣称模型“整体更强”或“具备前沿智能”,就属于证据不足的过度推断。

“ARC-C = 0.700 是前沿智能门槛”?不成立

DavidAU 在 Qwen3.6-27B Fable Fusion 711 模型卡中称,其 ARC-C 得分 0.711 意味着进入了“OpenAI、Claude 和 Gemini 的智能区间”,甚至配上“这就是他们害怕的模型”这类营销文案。

然而,ARC-C 从未被定义为通用智能标尺。2025 年 ACL 一篇论文《ARC “Challenge” 其实没那么难》指出,该测试的难度高度依赖评估格式,许多“挑战性”源于题目呈现方式而非内在复杂度。将单一数值(如 0.700)当作智能分水岭,缺乏学术依据。

更讽刺的是,官方 Qwen3.6-27B 模型卡报告了远更全面的能力矩阵,包括:

- SWE-bench Verified: 77.2
- Terminal-Bench 2.0: 59.3
- GPQA Diamond: 87.8
- LiveCodeBench v6: 83.9
- AIME26: 94.1

如果微调版只展示七项旧基准的提升,却不验证上述现代能力是否保留甚至退化,就无法支撑“整体更强”的结论。

内部矛盾:“完全无审查” vs 6% 拒绝率

在 Qwen3.5-9B The Defiant 模型卡中,DavidAU 宣称模型“完全无审查”“有问必答”。但同一张卡的性能表格却明确写着:拒绝次数 6/100。

若“完全无审查”字面意思是零拒绝,那这组数据直接自相矛盾。更诚实的描述应是“相比基模大幅减少拒绝”,而非绝对化表述。

长上下文能力:用 512 token 测试验证 2M?

Nightmedia 的 Qwen3.8-27B Brainwaves 模型声称“可安全 RoPE 扩展至 2M”。但支撑这一说法的评估仍是那七项短基准 + MLX 困惑度(perplexity)测试。

问题在于,mlx_lm.perplexity 脚本默认配置为:

- 序列长度:512 tokens
- 数据集:
allenai/tulu-3-sft-mixture(训练集) - 批处理:将无关样本拼接后切块

这意味着,所谓“2M 模型”的评估实际上在 512 token 块上进行。这只能证明 RoPE 修改未破坏短上下文性能,完全无法验证百万级上下文的实际表现。

真正的长上下文验证需包含:
- 不同长度(128K/256K/512K/1M/2M)下的关键信息检索
- 多针测试(multi-needle retrieval)
- 长文档问答准确率随深度的变化
- 内存占用与延迟实测
MLX 困惑度表的隐藏假设
Nightmedia 将困惑度数据归因于“标准 MLX 命令”,但这套流程有多个易被忽略的细节:
- 数据集非标准:默认使用指令微调混合数据集
tulu-3-sft-mixture的训练集,而非传统语言模型评估常用的 held-out 语料。 - 样本拼接失真:不同对话样本被强行拼接,导致 512-token 块可能跨越无关上下文边界,损失计算包含人为制造的过渡。
- 误差条误导:显示的标准差基于 token 级损失,但同一序列内 token 高度相关,实际不确定性被低估。
- 速度非生成速度:报告的 “tokens/sec” 是前向传播吞吐量,不等于聊天时的自回归生成速度(后者受 KV 缓存影响更大)。
- 内存峰值特定于 workload:512-token 测试的峰值内存无法反映 2M 上下文的真实需求。
这些细节若不加说明,极易让读者误读数据含义。
“标准 MLX 指标”?其实不存在
Nightmedia 在回复中称七项基准是“标准 MLX 指标”。但查阅 mlx_lm.evaluate 源码可知,它只是调用 lm-evaluation-harness,任务列表需用户显式指定(通过 --tasks 参数)。MLX 本身并未标准化这七项测试。
将其称为个人固定回归套件可以接受,但暗示这是 MLX 官方标准则具有误导性。
人类评估与 LLM 自评:证据等级不足
DavidAU 在 Qwen3.6-40B 模型卡中引用“人类测试”证明优势,但未说明评估协议(如提示词、评分标准、评估者数量等),使结果无法复现。
更离谱的是 Nightmedia 引用 Gemini 生成的模型评论,称其能“映射自身张量几何”。LLM 可以生成看似专业的内部机制描述,但这不等于模型真具备自我诊断能力——除非系统实际暴露了权重或诊断接口。
量化改进:需要配对实验,而非主观感受
双方都声称特定量化方法(如 NEO IMATRIX)带来 2–4% 准确率提升或“更好长上下文表现”。但 llama.cpp 文档仅说明重要性矩阵可能提升质量,效果取决于模型、量化类型和校准数据。
可靠验证需严格配对实验:
- 相同基模 checkpoint
- 相同 tokenizer 和模板
- 相同提示与解码设置
- 有/无 imatrix 的对比
- 置信区间或显著性检验
目前模型卡仅给出笼统断言,缺乏控制变量测试。
小分差需配对分析
当两个量化版本在 ARC-C 上得分分别为 0.604 和 0.591 时,仅看各自标准差不够。关键应分析分歧样本:A 对 B 错 vs A 错 B 对的数量。McNemar 检验等配对方法才能判断差异是否显著。
社区互动问题:批评消失,讨论受限
技术审计不应受作者态度影响,但社区监督机制值得关注。作者曾对 DavidAU 模型提出方法性质疑,随后:
- 相关讨论帖对其不可见
- Hugging Face 返回 403 错误(禁止互动)
- 多次请求补充 SWE-bench 数据未获回应
Nightmedia 则在讨论中要求停止“纠缠”,并暗示资历与尊重问题。虽然这不证明数据造假,但压制批评会削弱社区验证能力。
什么才算有说服力的评估?
要将营销话术转为可靠证据,模型卡应包含:
- 可复现性:精确的模型哈希、tokenizer 文件、chat template、工具链版本(mlx-lm/lm-eval)、命令行、随机种子、原始 JSON 输出。
- 现代能力覆盖:
- 推理:GPQA Diamond, MMLU-Pro
- 编码:LiveCodeBench, SWE-bench
- 智能体:Terminal-Bench, BFCL
- 长上下文:多长度检索准确率、内存/延迟实测
- 量化验证:配对实验、KL 散度、预填充/解码速度分离测量
- 人类评估:盲测评分、公开 rubric、负面案例
核心问题:数据被讲成了它无法证明的故事
基准分数本身可能是真实的,但解读常出错:
- ARC-C 提升 → “通用智能增强”?不一定。
- ARC-C > 0.7 → “进入前沿区间”?无依据。
- 2M 配置下短任务分数保持 → “2M 安全”?未验证。
- LLM 自评热情洋溢 → “具备内部认知”?不成立。
开源模型生态依赖可验证的信任,而非盲目相信作者。当声明从“此量化在特定 harness 下得分为 0.711”膨胀为“这是前沿智能”,所需证据也应相应扩展。
否则,再华丽的数字也只是营销修辞。