🟡 Embedding:AI 如何把”语言”变成”数字”

“国王 - 男人 + 女人 = ?” AI 能算出”女王”。 这不是魔法,是 Embedding。

🟡 AI 通识专栏 · 第 11 期 📅 2026年6月23日 ✍️ 小敏说 AI

💡 本文要点:Embedding 是 LLM 理解语言的”翻译层”——把每个词、每句话变成一串数字(向量),让相似的内容在数学上”靠近”。本文用一个直观的二维例子,把这个看似抽象的概念讲到你能用 Excel 复现。读完你也会理解:RAG、向量数据库、语义搜索的底层全是它。


🎯 本文导读

  • 🔹 为什么 AI 必须把语言变成数字
  • 🔹 一个二维例子:在地图上摆词
  • 🔹 国王 - 男人 + 女人 = 女王 的真实计算
  • 🔹 Embedding 的三大用途
  • 🔹 一段能让你”看懂 RAG 文章”的话术

一、🔢 先看结论:模型不懂”字”,只懂”数字”

计算机的世界里没有”猫”、”狗”、”国王”——只有数字。

你看到的 模型看到的
“猫” [0.21, -0.45, 0.83, ..., 0.12](一串 768 或 1536 个数字)
“狗” [0.18, -0.42, 0.79, ..., 0.15](和”猫”很像的另一串数字)
“汽车” [-0.65, 0.33, -0.11, ..., 0.78](和”猫”差很远的数字)

🎯 一句话总结:Embedding = 把每个词 / 句子 / 段落,映射成一个固定长度的数字向量,让”语义相近”的内容在数学上”距离近”。


二、🗺️ 一个二维例子:在地图上摆词

为了直观,我们把”几百维”简化成”二维”——想象一张地图:

y ▲
  │  👑 国王          🤴 女王
  │
  │      🐱 猫
  │   🐕 狗
  │
  │                      🚗 汽车
  │                  🚙 卡车
  │
  └──────────────────────────► x
  • “猫”和”狗”挨得近(都是宠物)
  • “国王”和”女王”挨得近(都是君主)
  • “汽车”和”卡车”挨得近(都是交通工具)
  • “猫”和”汽车”距离很远(语义无关)

💬 关键观点:距离 = 语义相似度。这是 Embedding 整个体系的核心思想。


三、🧮 国王 - 男人 + 女人 = 女王 的真实计算

这个被全网传烂的例子,其实就是向量加减法。

假设:

词 向量(极简版)
国王 [1.0, 0.9]
男人 [0.8, 0.1]
女人 [0.2, 0.1]
女王 [0.4, 0.9]

计算:

国王 - 男人 + 女人
= [1.0, 0.9] - [0.8, 0.1] + [0.2, 0.1]
= [0.4, 0.9]
= 女王 ✅

这说明 Embedding 编码了语义关系——”性别”这个维度被模型学到了,可以加减运算。

⚠️ 重要提醒:真实模型的向量是几百到几千维,单一维度通常没有可解释的含义,但维度的”组合”编码了丰富的语义关系。


四、📦 Embedding 是怎么”训练”出来的

Embedding 不是手工编的,是模型自己学出来的。

经典思路:“上下文相似的词,Embedding 也相似”(语言学里叫”分布式假设”)。

"我牵着 ___ 去散步" 
   → 这里大概率是 "狗" / "猫" / "孩子"
   → 所以"狗" / "猫" / "孩子"的 Embedding 会靠近
模型 输出维度 特点
Word2Vec (2013) 100-300 静态:一个词一个固定向量
BERT (2018) 768 上下文相关:同一个词在不同句子里向量不同
OpenAI text-embedding-3 1536-3072 大模型时代的工业级

🎯 现在主流 LLM 用的 Embedding,都是”上下文敏感”的——”苹果手机”里的”苹果”和”吃苹果”里的”苹果”,向量完全不同。


五、🚀 Embedding 的三大杀手级用途

传统搜索:找包含”降本增效“四个字的文档。 语义搜索:找意思相近的文档——比如”降低成本提高效率“也能命中。

做法:把所有文档变 Embedding,把查询也变 Embedding,找距离最近的几篇。

2️⃣ RAG(检索增强生成)

让 LLM “查资料”再回答的标准做法。

用户提问 → 转 Embedding → 在知识库里找最相近的几段 → 把这几段塞进 prompt → 让 LLM 基于这些资料回答

💬 关键观点:所有”AI 知识库”、”AI 客服”、”AI 助手”产品的底层,都是 Embedding + RAG。

3️⃣ 推荐系统

把每个用户、每个商品都变成 Embedding,距离近的就推荐给你。


六、🗃️ 向量数据库:专门存 Embedding 的仓库

当你有 100 万段文档、每段都是 1536 维向量,怎么快速找最相近的几个?

传统数据库扛不住——这就是 向量数据库 的来头。

产品 类型 适用场景
Pinecone 云托管 快速上手
Milvus 开源 自部署
Chroma 轻量级 个人项目
Qdrant 开源 + 云 性能优秀
FAISS Meta 出的库 嵌入应用

⚠️ 重要提醒:向量数据库本身不”理解”语言,它只是高效计算向量距离的工具。理解能力在 Embedding 模型里。


七、❌ 三个常见误区

误区 真相
❌ “Embedding 是 LLM 的一部分功能” Embedding 是独立的模型,可以单独训练、单独调用
❌ “维度越高 Embedding 越好” 维度高 → 更精细 + 更贵更慢,不是越高越好
✅ “RAG / 向量搜索 / 推荐 三件事,底层都是 Embedding” 对,理解了 Embedding 就理解了一大片 AI 应用

八、🎁 看懂 RAG 文章的速查话术

下次看到”我们用 OpenAI 的 text-embedding-3 + Pinecone 实现了文档问答”——

“这句话翻译成大白话是:

  1. text-embedding-3 把文档切成段、每段变成 1536 维向量
  2. Pinecone 是向量数据库,存这些向量
  3. 用户提问时,把问题也变向量,在 Pinecone 里找距离最近的几段
  4. 把这几段 + 原问题塞进 GPT 的 prompt,让它基于检索到的资料回答

整条链路的核心,就是用 Embedding 把’语义相似’变成’数学距离’。”


📮 今日话题

💬 你工作中最适合上 RAG 的场景是什么?

是公司内部知识库、客户 FAQ、行业法规库、还是会议纪要检索?评论区聊聊。


🔮 下一篇预告

🟡 AI 通识 · 第 12 期:预训练 / 微调 / RLHF——一个大模型是怎么炼成的

从一坨网络数据到 ChatGPT,中间到底经历了什么?


🟡 本文属于「AI 通识 · 阶段二:大模型怎么思考」。

📱 关注「小敏说 AI」,回复 「AI 入门」 领取《打工人 AI 自救工具箱》。