当基准测试分数变成营销话术:对 DavidAU 与 Nightmedia 模型声明的技术审计

0 阅读

当基准测试分数变成营销话术

在开源大模型社区,模型卡(model card)是用户判断模型能力的第一依据。理想情况下,它应提供可复现、方法透明、结论克制的评估数据。但现实中,一些热门模型卡正将有限的基准测试结果包装成宏大叙事——比如把 ARC-Challenge 分数 0.711 解读为“进入 OpenAI/Claude/Gemini 的智能区间”,或将七个旧基准的微小提升称为“最强开源微调”。

本文对 DavidAU 和 Nightmedia 发布的多个 Qwen3 系列模型卡进行了技术审计,聚焦一个核心问题:所展示的实验是否真正支持其能力声明?

七项基准的局限性

被反复使用的测试套件包括:

  • ARC-Challenge / ARC-Easy
  • BoolQ
  • HellaSwag
  • OpenBookQA
  • PIQA
  • WinoGrande

image

这些确实是合法的基准,诞生于 2018–2020 年,分别衡量阅读理解、物理常识、推理延续等窄域能力。问题不在于它们无效,而在于将其视为“通用智能”的代理指标

image

这套测试全是短文本、多项选择题,完全不涉及:

image

  • 仓库级代码生成(如 SWE-bench)
  • 终端自主操作(Terminal-Bench)
  • 百万 token 级长上下文检索
  • 工具调用或函数调用
  • 复杂数学竞赛题(如 AIME、HMMT)
  • 科学推理(GPQA Diamond)

image

保留这套作为历史回归基线没问题,但若据此宣称模型“整体更强”或“具备前沿智能”,就属于证据不足的过度推断。

image

“ARC-C = 0.700 是前沿智能门槛”?不成立

image

DavidAU 在 Qwen3.6-27B Fable Fusion 711 模型卡中称,其 ARC-C 得分 0.711 意味着进入了“OpenAI、Claude 和 Gemini 的智能区间”,甚至配上“这就是他们害怕的模型”这类营销文案。

image

然而,ARC-C 从未被定义为通用智能标尺。2025 年 ACL 一篇论文《ARC “Challenge” 其实没那么难》指出,该测试的难度高度依赖评估格式,许多“挑战性”源于题目呈现方式而非内在复杂度。将单一数值(如 0.700)当作智能分水岭,缺乏学术依据。

image

更讽刺的是,官方 Qwen3.6-27B 模型卡报告了远更全面的能力矩阵,包括:

image

  • SWE-bench Verified: 77.2
  • Terminal-Bench 2.0: 59.3
  • GPQA Diamond: 87.8
  • LiveCodeBench v6: 83.9
  • AIME26: 94.1

image

如果微调版只展示七项旧基准的提升,却不验证上述现代能力是否保留甚至退化,就无法支撑“整体更强”的结论。

image

内部矛盾:“完全无审查” vs 6% 拒绝率

image

在 Qwen3.5-9B The Defiant 模型卡中,DavidAU 宣称模型“完全无审查”“有问必答”。但同一张卡的性能表格却明确写着:拒绝次数 6/100

image

若“完全无审查”字面意思是零拒绝,那这组数据直接自相矛盾。更诚实的描述应是“相比基模大幅减少拒绝”,而非绝对化表述。

image

长上下文能力:用 512 token 测试验证 2M?

image

Nightmedia 的 Qwen3.8-27B Brainwaves 模型声称“可安全 RoPE 扩展至 2M”。但支撑这一说法的评估仍是那七项短基准 + MLX 困惑度(perplexity)测试。

image

问题在于,mlx_lm.perplexity 脚本默认配置为:

image

  • 序列长度:512 tokens
  • 数据集:allenai/tulu-3-sft-mixture(训练集)
  • 批处理:将无关样本拼接后切块

image

这意味着,所谓“2M 模型”的评估实际上在 512 token 块上进行。这只能证明 RoPE 修改未破坏短上下文性能,完全无法验证百万级上下文的实际表现

image

真正的长上下文验证需包含:

  • 不同长度(128K/256K/512K/1M/2M)下的关键信息检索
  • 多针测试(multi-needle retrieval)
  • 长文档问答准确率随深度的变化
  • 内存占用与延迟实测

MLX 困惑度表的隐藏假设

Nightmedia 将困惑度数据归因于“标准 MLX 命令”,但这套流程有多个易被忽略的细节:

  1. 数据集非标准:默认使用指令微调混合数据集 tulu-3-sft-mixture 的训练集,而非传统语言模型评估常用的 held-out 语料。
  2. 样本拼接失真:不同对话样本被强行拼接,导致 512-token 块可能跨越无关上下文边界,损失计算包含人为制造的过渡。
  3. 误差条误导:显示的标准差基于 token 级损失,但同一序列内 token 高度相关,实际不确定性被低估。
  4. 速度非生成速度:报告的 “tokens/sec” 是前向传播吞吐量,不等于聊天时的自回归生成速度(后者受 KV 缓存影响更大)。
  5. 内存峰值特定于 workload:512-token 测试的峰值内存无法反映 2M 上下文的真实需求。

这些细节若不加说明,极易让读者误读数据含义。

“标准 MLX 指标”?其实不存在

Nightmedia 在回复中称七项基准是“标准 MLX 指标”。但查阅 mlx_lm.evaluate 源码可知,它只是调用 lm-evaluation-harness任务列表需用户显式指定(通过 --tasks 参数)。MLX 本身并未标准化这七项测试。

将其称为个人固定回归套件可以接受,但暗示这是 MLX 官方标准则具有误导性。

人类评估与 LLM 自评:证据等级不足

DavidAU 在 Qwen3.6-40B 模型卡中引用“人类测试”证明优势,但未说明评估协议(如提示词、评分标准、评估者数量等),使结果无法复现。

更离谱的是 Nightmedia 引用 Gemini 生成的模型评论,称其能“映射自身张量几何”。LLM 可以生成看似专业的内部机制描述,但这不等于模型真具备自我诊断能力——除非系统实际暴露了权重或诊断接口。

量化改进:需要配对实验,而非主观感受

双方都声称特定量化方法(如 NEO IMATRIX)带来 2–4% 准确率提升或“更好长上下文表现”。但 llama.cpp 文档仅说明重要性矩阵可能提升质量,效果取决于模型、量化类型和校准数据

可靠验证需严格配对实验:

  • 相同基模 checkpoint
  • 相同 tokenizer 和模板
  • 相同提示与解码设置
  • 有/无 imatrix 的对比
  • 置信区间或显著性检验

目前模型卡仅给出笼统断言,缺乏控制变量测试。

小分差需配对分析

当两个量化版本在 ARC-C 上得分分别为 0.604 和 0.591 时,仅看各自标准差不够。关键应分析分歧样本:A 对 B 错 vs A 错 B 对的数量。McNemar 检验等配对方法才能判断差异是否显著。

社区互动问题:批评消失,讨论受限

技术审计不应受作者态度影响,但社区监督机制值得关注。作者曾对 DavidAU 模型提出方法性质疑,随后:

  • 相关讨论帖对其不可见
  • Hugging Face 返回 403 错误(禁止互动)
  • 多次请求补充 SWE-bench 数据未获回应

Nightmedia 则在讨论中要求停止“纠缠”,并暗示资历与尊重问题。虽然这不证明数据造假,但压制批评会削弱社区验证能力

什么才算有说服力的评估?

要将营销话术转为可靠证据,模型卡应包含:

  • 可复现性:精确的模型哈希、tokenizer 文件、chat template、工具链版本(mlx-lm/lm-eval)、命令行、随机种子、原始 JSON 输出。
  • 现代能力覆盖
    • 推理:GPQA Diamond, MMLU-Pro
    • 编码:LiveCodeBench, SWE-bench
    • 智能体:Terminal-Bench, BFCL
    • 长上下文:多长度检索准确率、内存/延迟实测
  • 量化验证:配对实验、KL 散度、预填充/解码速度分离测量
  • 人类评估:盲测评分、公开 rubric、负面案例

核心问题:数据被讲成了它无法证明的故事

基准分数本身可能是真实的,但解读常出错:

  • ARC-C 提升 → “通用智能增强”?不一定。
  • ARC-C > 0.7 → “进入前沿区间”?无依据。
  • 2M 配置下短任务分数保持 → “2M 安全”?未验证。
  • LLM 自评热情洋溢 → “具备内部认知”?不成立。

开源模型生态依赖可验证的信任,而非盲目相信作者。当声明从“此量化在特定 harness 下得分为 0.711”膨胀为“这是前沿智能”,所需证据也应相应扩展。

否则,再华丽的数字也只是营销修辞。