🔵 Fine-tuning 实战:LoRA + 100 条数据,把通用模型微调成”你的助理”

通用模型像”全科医生”, 微调后的模型像”你的家庭医生”——更懂你的话风、规则、偏好。 而 LoRA,是让这件事普通人也能做的革命性技术。

🔵 AI 通识专栏 · 第 37 期 📅 2026年8月22日 ✍️ 小敏说 AI

💡 本文要点:本文用人话讲清 LoRA 是什么、为什么 100 条数据也能微调、什么场景适合 / 不适合微调、以及一份”今天就能跑”的微调流程。


🎯 本文导读

  • 🔹 全量微调 vs LoRA 一句话区别
  • 🔹 LoRA 为什么省到离谱
  • 🔹 适合微调 vs 应该用 RAG
  • 🔹 100 条数据怎么准备
  • 🔹 微调流程速览

一、⚖️ 全量微调 vs LoRA

维度 全量微调 LoRA
改动参数 全部 只动 0.1%-1%
显存 海量 大幅降低
速度 慢 快 10-100 倍
易上手 ❌ ✅
效果差距 0% 3-10%

💬 关键观点:LoRA 用 1% 的成本,拿到 90%+ 的微调效果。这是它能”民主化”的根本原因。


二、🧪 LoRA 为什么省到离谱

原理简化版:

原模型权重 W 不动(冻结)
新加一对小矩阵 A × B(参数量极小)
最终输出 = W × x + (A × B) × x

只训练 A 和 B,模型主体不动。

✅ 训练后 LoRA 权重通常只有 几 MB - 几十 MB,比模型本体小 100-1000 倍。


三、🤔 适合微调 vs 应该用 RAG

你的需求 选
让 AI 学事实 RAG
让 AI 学风格 / 口吻 微调
让 AI 学固定格式 微调
让 AI 学领域术语 + 数据并存 微调 + RAG

🎯 一句话总结:事实用 RAG,行为用微调。


四、📝 100 条数据怎么准备

格式(多数框架统一):

{"instruction": "用户问了什么", "input": "可选输入", "output": "理想答案"}

关键原则

原则 怎么做
质量 > 数量 100 条精品 > 10000 条垃圾
覆盖典型场景 包含 5-10 种问法变体
统一风格 长度、格式、语气一致
加反例 “这种情况你应该拒绝回答”
人工二审 标注者必须懂业务

⚠️ 真实经验:100 条精心标注 ≈ 1000 条粗标注。


五、🛠 微调流程速览

Step 1:数据准备(JSON 格式 100-1000 条)
Step 2:选基础模型(Qwen 7B / Llama 8B 起步)
Step 3:选框架(LLaMA-Factory 最易上手)
Step 4:跑训练(家用 4090 ≈ 几小时)
Step 5:合并 + 量化 + 部署
Step 6:评测(对比微调前 vs 后)

推荐入门工具

  • LLaMA-Factory —— 网页 UI,0 代码可微调
  • Unsloth —— 速度最快、显存最省
  • MLX-LM —— Mac 专属

六、💼 5 个真实落地场景

  1. ✍️ 公众号助手 —— 微调成”小敏文风”
  2. 🤖 企业客服 —— 学公司 FAQ + 拒绝政治敏感问题
  3. 📜 法律助手 —— 学固定回答格式
  4. 🧾 报销助手 —— 学公司报销规则
  5. 💻 代码风格审查 —— 学公司代码规范

七、❌ 常见误区

误区 真相
❌ 微调让模型变更聪明 ✅ 只改风格 / 格式,智商靠基模
❌ 数据越多越好 ✅ 质量第一
❌ 微调取代 RAG ✅ 解决不同问题
❌ 微调过的模型不会幻觉 ✅ 仍会,特别在训练数据之外

八、🎁 给非工程师的”微调心法”

🔑 把它当"教 AI 一种说话风格",而不是"让 AI 学新知识"
🔑 100 条精品数据 + LoRA = 改变 AI 80% 的输出风格
🔑 微调完一定要做 A/B 对比
🔑 别期待它做"模型本来不会的事"

📮 今日话题:如果你能微调一个 AI,你最想给它教什么”风格”?

🔮 下一篇预告:ep38《评测体系:MMLU / HumanEval / Chatbot Arena——看 AI 谁更强,到底信哪个榜》


🔵 本系列是「小敏说 AI · AI 通识专栏」第 37 期。 关注公众号 小敏说 AI,回复「AI 入门」领取《打工人 AI 自救工具箱》。