🟡 Embedding:AI 如何把"语言"变成"数字"
🟡 Embedding:AI 如何把”语言”变成”数字”
“国王 - 男人 + 女人 = ?” AI 能算出”女王”。 这不是魔法,是 Embedding。
🟡 AI 通识专栏 · 第 11 期 📅 2026年6月23日 ✍️ 小敏说 AI
💡 本文要点:Embedding 是 LLM 理解语言的”翻译层”——把每个词、每句话变成一串数字(向量),让相似的内容在数学上”靠近”。本文用一个直观的二维例子,把这个看似抽象的概念讲到你能用 Excel 复现。读完你也会理解:RAG、向量数据库、语义搜索的底层全是它。
🎯 本文导读
- 🔹 为什么 AI 必须把语言变成数字
- 🔹 一个二维例子:在地图上摆词
- 🔹 国王 - 男人 + 女人 = 女王 的真实计算
- 🔹 Embedding 的三大用途
- 🔹 一段能让你”看懂 RAG 文章”的话术
一、🔢 先看结论:模型不懂”字”,只懂”数字”
计算机的世界里没有”猫”、”狗”、”国王”——只有数字。
| 你看到的 | 模型看到的 |
|---|---|
| “猫” | [0.21, -0.45, 0.83, ..., 0.12](一串 768 或 1536 个数字) |
| “狗” | [0.18, -0.42, 0.79, ..., 0.15](和”猫”很像的另一串数字) |
| “汽车” | [-0.65, 0.33, -0.11, ..., 0.78](和”猫”差很远的数字) |
🎯 一句话总结:Embedding = 把每个词 / 句子 / 段落,映射成一个固定长度的数字向量,让”语义相近”的内容在数学上”距离近”。
二、🗺️ 一个二维例子:在地图上摆词
为了直观,我们把”几百维”简化成”二维”——想象一张地图:
y ▲
│ 👑 国王 🤴 女王
│
│ 🐱 猫
│ 🐕 狗
│
│ 🚗 汽车
│ 🚙 卡车
│
└──────────────────────────► x
- “猫”和”狗”挨得近(都是宠物)
- “国王”和”女王”挨得近(都是君主)
- “汽车”和”卡车”挨得近(都是交通工具)
- “猫”和”汽车”距离很远(语义无关)
💬 关键观点:距离 = 语义相似度。这是 Embedding 整个体系的核心思想。
三、🧮 国王 - 男人 + 女人 = 女王 的真实计算
这个被全网传烂的例子,其实就是向量加减法。
假设:
| 词 | 向量(极简版) |
|---|---|
| 国王 | [1.0, 0.9] |
| 男人 | [0.8, 0.1] |
| 女人 | [0.2, 0.1] |
| 女王 | [0.4, 0.9] |
计算:
国王 - 男人 + 女人
= [1.0, 0.9] - [0.8, 0.1] + [0.2, 0.1]
= [0.4, 0.9]
= 女王 ✅
这说明 Embedding 编码了语义关系——”性别”这个维度被模型学到了,可以加减运算。
⚠️ 重要提醒:真实模型的向量是几百到几千维,单一维度通常没有可解释的含义,但维度的”组合”编码了丰富的语义关系。
四、📦 Embedding 是怎么”训练”出来的
Embedding 不是手工编的,是模型自己学出来的。
经典思路:“上下文相似的词,Embedding 也相似”(语言学里叫”分布式假设”)。
"我牵着 ___ 去散步"
→ 这里大概率是 "狗" / "猫" / "孩子"
→ 所以"狗" / "猫" / "孩子"的 Embedding 会靠近
| 模型 | 输出维度 | 特点 |
|---|---|---|
| Word2Vec (2013) | 100-300 | 静态:一个词一个固定向量 |
| BERT (2018) | 768 | 上下文相关:同一个词在不同句子里向量不同 |
| OpenAI text-embedding-3 | 1536-3072 | 大模型时代的工业级 |
🎯 现在主流 LLM 用的 Embedding,都是”上下文敏感”的——”苹果手机”里的”苹果”和”吃苹果”里的”苹果”,向量完全不同。
五、🚀 Embedding 的三大杀手级用途
1️⃣ 语义搜索(Semantic Search)
传统搜索:找包含”降本增效“四个字的文档。 语义搜索:找意思相近的文档——比如”降低成本提高效率“也能命中。
做法:把所有文档变 Embedding,把查询也变 Embedding,找距离最近的几篇。
2️⃣ RAG(检索增强生成)
让 LLM “查资料”再回答的标准做法。
用户提问 → 转 Embedding → 在知识库里找最相近的几段 → 把这几段塞进 prompt → 让 LLM 基于这些资料回答
💬 关键观点:所有”AI 知识库”、”AI 客服”、”AI 助手”产品的底层,都是 Embedding + RAG。
3️⃣ 推荐系统
把每个用户、每个商品都变成 Embedding,距离近的就推荐给你。
六、🗃️ 向量数据库:专门存 Embedding 的仓库
当你有 100 万段文档、每段都是 1536 维向量,怎么快速找最相近的几个?
传统数据库扛不住——这就是 向量数据库 的来头。
| 产品 | 类型 | 适用场景 |
|---|---|---|
| Pinecone | 云托管 | 快速上手 |
| Milvus | 开源 | 自部署 |
| Chroma | 轻量级 | 个人项目 |
| Qdrant | 开源 + 云 | 性能优秀 |
| FAISS | Meta 出的库 | 嵌入应用 |
⚠️ 重要提醒:向量数据库本身不”理解”语言,它只是高效计算向量距离的工具。理解能力在 Embedding 模型里。
七、❌ 三个常见误区
| 误区 | 真相 |
|---|---|
| ❌ “Embedding 是 LLM 的一部分功能” | Embedding 是独立的模型,可以单独训练、单独调用 |
| ❌ “维度越高 Embedding 越好” | 维度高 → 更精细 + 更贵更慢,不是越高越好 |
| ✅ “RAG / 向量搜索 / 推荐 三件事,底层都是 Embedding” | 对,理解了 Embedding 就理解了一大片 AI 应用 |
八、🎁 看懂 RAG 文章的速查话术
下次看到”我们用 OpenAI 的 text-embedding-3 + Pinecone 实现了文档问答”——
“这句话翻译成大白话是:
- text-embedding-3 把文档切成段、每段变成 1536 维向量
- Pinecone 是向量数据库,存这些向量
- 用户提问时,把问题也变向量,在 Pinecone 里找距离最近的几段
- 把这几段 + 原问题塞进 GPT 的 prompt,让它基于检索到的资料回答
整条链路的核心,就是用 Embedding 把’语义相似’变成’数学距离’。”
📮 今日话题
💬 你工作中最适合上 RAG 的场景是什么?
是公司内部知识库、客户 FAQ、行业法规库、还是会议纪要检索?评论区聊聊。
🔮 下一篇预告
🟡 AI 通识 · 第 12 期:预训练 / 微调 / RLHF——一个大模型是怎么炼成的
从一坨网络数据到 ChatGPT,中间到底经历了什么?
🟡 本文属于「AI 通识 · 阶段二:大模型怎么思考」。
📱 关注「小敏说 AI」,回复 「AI 入门」 领取《打工人 AI 自救工具箱》。