🟣 训练数据工程:从 The Pile 到合成数据
🟣 训练数据工程:从 The Pile 到合成数据
大模型的能力, 1/3 来自架构, 1/3 来自算力, 1/3 来自数据。 而 2026 年,”数据”这一项越来越像一门工程。
🟣 AI 深度派专栏 · 第 S2-13 期 📅 2026年10月13日 ✍️ 小敏说 AI
💡 本文要点:本文讲清训练数据的”四代演进”——抓全网 → 高质量过滤 → 课程学习 → 合成数据;为什么”数据品质”已成决定性因素;以及”数据耗尽”这个产业级危机。
🎯 本文导读
- 🔹 训练数据为什么是天花板
- 🔹 四代演进
- 🔹 数据过滤的工程化
- 🔹 合成数据:救命稻草还是慢性毒药
- 🔹 数据耗尽危机
一、📚 数据为什么是天花板
模型能力 ≈ f(算力, 参数, 数据)
实测:同等算力 + 参数,数据质量差一倍,能力差 2-5 倍。
💬 关键观点:Scaling Law 已悄悄从”算力主导”变成”数据品质主导”。
二、🪜 四代演进
第一代:抓全网(2018-2021)
代表:Common Crawl、The Pile、C4
做法:把全网爬下来 → 去重 → 训练
特征:海量 + 杂
✅ 让 GPT-3 / Llama 1 成为可能 ❌ 充斥垃圾、广告、重复
第二代:高质量过滤(2022-2023)
代表:RefinedWeb、Dolma、FineWeb
做法:用规则 + 分类器筛"高质量"
特征:少而精,1/10 量但能力反超
🎯 观点:数据质量 > 数据数量 在这一代被工程验证。
第三代:课程学习 + 阶段化(2023-2024)
代表:Llama 3、Qwen 2.5、DeepSeek V2/V3
做法:分阶段——先杂后精,先短后长,先通用后专业
特征:训练计划像"小学→中学→大学"
第四代:合成数据 + Self-play(2024-)
代表:Phi 系列、R1、Qwen QwQ
做法:让强模型出题、答题 → 训弱模型
特征:可控、规模无上限、可定向能力
三、🧪 数据过滤的工程化
主流数据 pipeline 包含 10+ 步:
| 阶段 | 做什么 |
|---|---|
| 去重 | 文档级 + 句子级 + 模糊去重 |
| 语言识别 | 按语种分桶 |
| 质量分类器 | 用小模型给文档打分 |
| 垃圾过滤 | 广告、SEO 内容、低信息文本 |
| 毒性过滤 | NSFW、暴力、偏见 |
| 隐私脱敏 | 邮箱、手机号、地址 |
| 领域配比 | 代码 / 数学 / 中文 / 学术 比例 |
| 课程排序 | 由易到难 |
⚠️ 重要提醒:数据工程 = 大模型团队 30-50% 的工程量。
四、🧬 合成数据:救命稻草还是毒药
优点
| 优点 | 描述 | |—|—| | 可控 | 想强化什么就生成什么 | | 可扩 | 用 API 出题,理论无上限 | | 可标注 | 答案自动校验(数学、代码) | | 可定向 | 弥补真实数据稀缺领域 |
风险
| 风险 | 描述 | |—|—| | 模型崩溃(Model Collapse) | 反复用 AI 数据训 AI,质量下滑 | | 同质化 | 风格 / 思路趋同 | | 错误放大 | 生成数据自带偏见 | | 可解释性差 | “为什么这个题被生成”难追溯 |
✅ 主流方案:真实数据为基底 + 合成数据为补充(70/30 或 80/20)。
💬 关键观点:纯合成数据训不出 SOTA,但合成数据已成”必备配料”。
五、⚠️ 数据耗尽危机
| 现象 | 描述 |
|---|---|
| 2023 年 | The Pile 类语料已被多次反复用 |
| 2024 年 | 高质量英文文本”快用光” |
| 2025 年 | 多家厂商开始买授权(出版社、新闻媒体) |
| 2026 年 | 合成数据成为标配 |
🎯 一句话总结:互联网上的”免费高质量文本” 不够用了。
六、💰 数据的商业化
| 趋势 | 描述 |
|---|---|
| 数据交易平台 | Common Voice、Anthropic-Scale Reuters |
| 出版社授权 | 纽约时报、AP 等开始售卖语料 |
| 机器人数据公司 | Scale AI、Surge AI 等估值百亿 |
| 数据标注新蓝海 | 印度 / 东南亚 / 中国一线城市 |
七、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ 数据越多越好 | ✅ 质量优先 |
| ❌ 中文数据已够 | ✅ 高质量中文严重不足 |
| ❌ 合成数据 = 自欺欺人 | ✅ 已成基础工具 |
| ❌ 抓什么训什么 | ✅ 现代 pipeline 严选 |
八、🎁 给非工程读者的”数据心法”
🔑 模型能力 = 算力 + 参数 + 数据三角
🔑 2026 年数据是最被低估的瓶颈
🔑 真实 + 合成混合是必然
🔑 看一家公司的模型实力 → 看它的"数据工程团队"
📮 今日话题:你愿意把自己的高质量笔记 / 文章授权给 AI 训练吗?多少钱合理?
🔮 下一篇预告:s2ep14《模型评测的”作弊学”:污染、提示工程、Goodhart》
🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-13 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。