🟣 模型评测的”作弊学”:污染、提示工程、Goodhart

每年都有新模型”屠榜”。 但榜分越来越没人信。 因为大家都知道: 评测可以”作弊”,而且作弊方式越来越隐蔽。

🟣 AI 深度派专栏 · 第 S2-14 期 📅 2026年10月15日 ✍️ 小敏说 AI

💡 本文要点:本文系统讲解 LLM 评测的”作弊”图谱——数据污染、提示工程、过拟合 benchmark、Goodhart’s Law,以及”难以作弊”的评测设计。


🎯 本文导读

  • 🔹 Goodhart’s Law:评测的诅咒
  • 🔹 作弊手法 1:数据污染
  • 🔹 作弊手法 2:提示工程
  • 🔹 作弊手法 3:定向优化
  • 🔹 难以作弊的评测设计

一、📜 Goodhart’s Law

“当一个指标变成目标,它就不再是好指标。”

这条 50 年前的社会学定律,100% 适用于今天的 AI 评测:

  • MMLU 变目标 → 大家刷 MMLU
  • GSM8K 变目标 → 大家刷 GSM8K
  • 榜单变商业卖点 → 整个行业都在刷

💬 关键观点:任何一个广泛使用的 benchmark,最终都会被”卷穿”——不再反映真实能力。


二、☣️ 作弊手法 1:数据污染(Contamination)

直接污染

把 benchmark 的题直接放进训练集:

  • 故意 → 现在不太敢,会被打脸
  • 不小心 → 几乎不可避免(爬全网就会爬到)

间接污染

  • 训练数据里有题目讨论
  • 用 GPT-4 生成数据时不慎包含题
  • 网上博客把题贴出来分析

实测

  • 一项研究:从训练数据里找 benchmark 题”出现过”的占比,部分模型高达 20%+
  • 一旦污染:分数飙升 5-15%

⚠️ 重要提醒:没法 100% 清除污染。最佳实践是用”实时更新的活体 benchmark”。


三、💬 作弊手法 2:提示工程

同一题不同 Prompt 分数能差 10-30%:

技巧 加分
“Let’s think step by step” +5-10%
Few-shot +3-15%
Self-consistency(多次采样投票) +5-10%
角色扮演 +2-5%
输出格式约束 +1-3%

💬 关键观点:厂商发模型时用最强 prompt,你用时是默认 prompt——差距巨大。


四、🎯 作弊手法 3:定向优化

Step 1:研究 benchmark 题型
Step 2:构造大量同类型合成数据
Step 3:训练 / 微调
Step 4:分数飙升
Step 5:发布"屠榜"模型

✅ 不违法,但真实能力可能没多大提升。

特别在小型 / 学术 benchmark 上极易发生。


五、🛡 难以作弊的评测设计

设计 1:活体 + 私密题库

  • LMSYS、Scale AI 等持续生成新题
  • 不公开

设计 2:真人盲测

  • Chatbot Arena —— 真人投票
  • 几乎无法定向作弊

设计 3:可验证的真实任务

  • SWE-Bench:真实 GitHub bug 修复
  • GAIA:真实多步骤 Agent 任务
  • WebArena:真实网页操作

设计 4:动态生成题

  • 让强模型每次生成全新变体
  • 训练时不可能见过

🎯 一句话总结:好评测的特征:题不公开 + 真人参与 + 真实任务 + 持续更新。


六、📊 当前评测可信度排序(个人观点)

排名 评测 原因
🥇 Chatbot Arena 真人 + 匿名 + 海量
🥈 SWE-Bench 真实任务,难刷
🥉 GAIA / WebArena Agent 实战
4 MMLU-Pro / GPQA 比 MMLU 难、新
5 HumanEval / MBPP 已部分污染
6 MMLU 原版 几乎被卷穿

七、🔍 怎么判断一个”屠榜”模型靠不靠谱

5 步速查:

1. 看 Chatbot Arena 是否同步上升
2. 看 SWE-Bench / GAIA 等真实任务
3. 自己拿 10 个真实问题盲测
4. 看社区 reddit、知乎、HuggingFace 讨论
5. 等 2-4 周——污染争议通常很快爆出

八、❌ 常见误区

误区 真相
❌ 屠榜 = 真厉害 ✅ 必须看真实任务
❌ Arena 分数也能刷 ✅ 投票量太大,刷成本极高
❌ 多榜并行不会作弊 ✅ 综合刷分仍可能
❌ 闭源比开源诚实 ✅ 双方都有动机

九、🎁 给非工程读者的”评测心法”

🔑 单一榜 ≠ 真实能力
🔑 看模型 → 看 Arena + 真实任务榜 + 自己测
🔑 厂商发的对比图,默认带"美颜滤镜"
🔑 自己业务最重要的 10 个问题 = 你自己的 benchmark

📮 今日话题:你被哪个”屠榜”模型让你失望过?

🔮 下一篇预告:s2ep15《一张图看懂 2026 年大模型架构演进(阶段六收尾)》


🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-14 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。