🟣 Embedding 深度:从 word2vec 到 contrastive
🟣 Embedding 深度:从 word2vec 到 contrastive
Embedding 是 AI 的”通用语言”。 它把文字、图、声音、行为全部”翻译”成一组数字。 这一篇,把它从 word2vec 一直讲到 2026 年的对比学习。
🟣 AI 深度派专栏 · 第 S2-11 期 📅 2026年10月8日 ✍️ 小敏说 AI
💡 本文要点:本文以一条时间线讲清 Embedding 的进化——word2vec → GloVe → BERT 句嵌入 → SBERT → 对比学习时代(BGE / E5 / M3)。讲清”句向量好不好”的真正决定因素。
🎯 本文导读
- 🔹 Embedding 一句话定义
- 🔹 word2vec 的革命
- 🔹 BERT 时代 vs SBERT
- 🔹 对比学习(CLIP / SimCSE)
- 🔹 2026 年的最强嵌入模型
一、📐 一句话定义
Embedding = 把任何对象(词 / 句 / 图 / 用户)压成一组数字,让”语义相近”的对象在向量空间里”距离近”。
💬 关键观点:好 Embedding 的核心标准是”语义相近 = 距离近”。
二、🎬 word2vec:第一次大众化
2013 年 Google 的 Mikolov:
训练目标
“上下文里出现过的词,向量应相近”:
- Skip-gram:用中心词预测上下文
- CBOW:用上下文预测中心词
神奇现象
king - man + woman ≈ queen
Paris - France + Italy ≈ Rome
✅ Embedding 第一次让”词义”变成”数学”。
❌ 局限:一个词只有一个向量,”bank(银行)”和”bank(河岸)”分不开。
三、🦾 BERT 时代:上下文相关
2018 年 BERT 把 Embedding 变成上下文相关:
"bank account" 里的 bank → 一个向量
"river bank" 里的 bank → 另一个向量
但 BERT 是为 token-level 任务设计,直接拿来做句向量效果差。
痛点
- BERT [CLS] token 不是好句向量
- 同一句话不同长度,向量也不同
- 没有”语义距离”的明确目标
四、🎯 SBERT:用”双塔 + 对比”训练
2019 年 Sentence-BERT:
Anchor 句 → 编码 → A
正样本(同义) → 编码 → B
负样本(不同义) → 编码 → C
Loss:让 A、B 靠近,A、C 远离
✅ 第一次把 BERT 调成”句向量神器”。
🎯 一句话总结:句向量的关键是”用对比目标训练”。
五、🌐 对比学习:跨模态、跨语言、跨任务
CLIP(OpenAI 2021)
- 图文匹配
- 一张图 + 它的标题应该向量相近
- 打开了多模态检索的大门
SimCSE
- 同一句话过两次 dropout → 两个版本应相近
- 无监督 SOTA
E5 / BGE / M3-Embedding
- 国产开源王者
- 多语言 + 多任务 + 长文本 兼顾
- 2026 年 RAG 大量使用
六、📊 2026 年主流 Embedding 模型
| 模型 | 强项 |
|---|---|
| OpenAI text-embedding-3-large | 通用 + 多语言 |
| Cohere Embed v3 | 检索专用 |
| BGE-M3(智源) | 中文 + 长文 + 稀疏 + 密集多功能 |
| NV-Embed(Nvidia) | 顶级英文检索 |
| GTE / E5(阿里) | 工业级稳 |
选型建议
| 场景 | 推荐 | |—|—| | 中文 RAG | BGE-M3 | | 英文长文档 | NV-Embed / OpenAI | | 多语言客服 | M3-Embedding | | 个人项目 | BGE-base 系列(小+免费) |
七、📏 Embedding 评测
主流 benchmark:MTEB(Massive Text Embedding Benchmark)。
涵盖:
- 检索(Retrieval)
- 重排序(Reranking)
- 分类
- 聚类
- 语义相似
⚠️ 重要提醒:别只看总分——你的业务可能只关心”检索”或”中文”这一两项。
八、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ 维度越高越好 | ✅ 1024 维已够多数场景 |
| ❌ Embedding 越大模型越准 | ✅ 训练目标比规模重要 |
| ❌ 一个 Embedding 通用所有任务 | ✅ 任务专用模型更强 |
| ❌ 用 LLM 直接拿 hidden state | ✅ 没对比训练,效果差 |
九、🎁 给非工程读者的”Embedding 心法”
🔑 Embedding 是 AI 世界的"通用货币"
🔑 好 Embedding = 用"对比学习"训出来
🔑 中文场景默认选 BGE-M3
🔑 自己业务最好测一遍 MTEB 关键子任务
📮 今日话题:你最近接触的 AI 应用,背后大概率用了 Embedding——你能猜到是哪一个吗?
🔮 下一篇预告:s2ep12《多模态对齐:CLIP / SigLIP / 视觉 token 化》
🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-11 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。