🟣 模型评测的”作弊学”:污染、提示工程、Goodhart
每年都有新模型”屠榜”。 但榜分越来越没人信。 因为大家都知道: 评测可以”作弊”,而且作弊方式越来越隐蔽。
🟣 AI 深度派专栏 · 第 S2-14 期 📅 2026年10月15日 ✍️ 小敏说 AI
💡 本文要点:本文系统讲解 LLM 评测的”作弊”图谱——数据污染、提示工程、过拟合 benchmark、Goodhart’s Law,以及”难以作弊”的评测设计。
🎯 本文导读
- 🔹 Goodhart’s Law:评测的诅咒
- 🔹 作弊手法 1:数据污染
- 🔹 作弊手法 2:提示工程
- 🔹 作弊手法 3:定向优化
- 🔹 难以作弊的评测设计
一、📜 Goodhart’s Law
“当一个指标变成目标,它就不再是好指标。”
这条 50 年前的社会学定律,100% 适用于今天的 AI 评测:
- MMLU 变目标 → 大家刷 MMLU
- GSM8K 变目标 → 大家刷 GSM8K
- 榜单变商业卖点 → 整个行业都在刷
💬 关键观点:任何一个广泛使用的 benchmark,最终都会被”卷穿”——不再反映真实能力。
二、☣️ 作弊手法 1:数据污染(Contamination)
直接污染
把 benchmark 的题直接放进训练集:
- 故意 → 现在不太敢,会被打脸
- 不小心 → 几乎不可避免(爬全网就会爬到)
间接污染
- 训练数据里有题目讨论
- 用 GPT-4 生成数据时不慎包含题
- 网上博客把题贴出来分析
实测
- 一项研究:从训练数据里找 benchmark 题”出现过”的占比,部分模型高达 20%+
- 一旦污染:分数飙升 5-15%
⚠️ 重要提醒:没法 100% 清除污染。最佳实践是用”实时更新的活体 benchmark”。
三、💬 作弊手法 2:提示工程
同一题不同 Prompt 分数能差 10-30%:
| 技巧 | 加分 |
|---|---|
| “Let’s think step by step” | +5-10% |
| Few-shot | +3-15% |
| Self-consistency(多次采样投票) | +5-10% |
| 角色扮演 | +2-5% |
| 输出格式约束 | +1-3% |
💬 关键观点:厂商发模型时用最强 prompt,你用时是默认 prompt——差距巨大。
四、🎯 作弊手法 3:定向优化
Step 1:研究 benchmark 题型
Step 2:构造大量同类型合成数据
Step 3:训练 / 微调
Step 4:分数飙升
Step 5:发布"屠榜"模型
✅ 不违法,但真实能力可能没多大提升。
特别在小型 / 学术 benchmark 上极易发生。
五、🛡 难以作弊的评测设计
设计 1:活体 + 私密题库
- LMSYS、Scale AI 等持续生成新题
- 不公开
设计 2:真人盲测
- Chatbot Arena —— 真人投票
- 几乎无法定向作弊
设计 3:可验证的真实任务
- SWE-Bench:真实 GitHub bug 修复
- GAIA:真实多步骤 Agent 任务
- WebArena:真实网页操作
设计 4:动态生成题
- 让强模型每次生成全新变体
- 训练时不可能见过
🎯 一句话总结:好评测的特征:题不公开 + 真人参与 + 真实任务 + 持续更新。
六、📊 当前评测可信度排序(个人观点)
| 排名 | 评测 | 原因 |
|---|---|---|
| 🥇 | Chatbot Arena | 真人 + 匿名 + 海量 |
| 🥈 | SWE-Bench | 真实任务,难刷 |
| 🥉 | GAIA / WebArena | Agent 实战 |
| 4 | MMLU-Pro / GPQA | 比 MMLU 难、新 |
| 5 | HumanEval / MBPP | 已部分污染 |
| 6 | MMLU 原版 | 几乎被卷穿 |
七、🔍 怎么判断一个”屠榜”模型靠不靠谱
5 步速查:
1. 看 Chatbot Arena 是否同步上升
2. 看 SWE-Bench / GAIA 等真实任务
3. 自己拿 10 个真实问题盲测
4. 看社区 reddit、知乎、HuggingFace 讨论
5. 等 2-4 周——污染争议通常很快爆出
八、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ 屠榜 = 真厉害 | ✅ 必须看真实任务 |
| ❌ Arena 分数也能刷 | ✅ 投票量太大,刷成本极高 |
| ❌ 多榜并行不会作弊 | ✅ 综合刷分仍可能 |
| ❌ 闭源比开源诚实 | ✅ 双方都有动机 |
九、🎁 给非工程读者的”评测心法”
🔑 单一榜 ≠ 真实能力
🔑 看模型 → 看 Arena + 真实任务榜 + 自己测
🔑 厂商发的对比图,默认带"美颜滤镜"
🔑 自己业务最重要的 10 个问题 = 你自己的 benchmark
📮 今日话题:你被哪个”屠榜”模型让你失望过?
🔮 下一篇预告:s2ep15《一张图看懂 2026 年大模型架构演进(阶段六收尾)》
🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-14 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。