🟡 上下文窗口:为什么有的模型记性好,有的”金鱼脑”
你把一本 300 页的 PDF 丢给模型, 它要么”全文吃下”侃侃而谈,要么”看到后面忘了前面”。 决定它能不能记住的,是一个叫”上下文窗口”的东西。
🟡 AI 通识专栏 · 第 15 期 📅 2026年7月2日 ✍️ 小敏说 AI
💡 本文要点:上下文窗口(Context Window)是 LLM 一次能”看到”的 Token 总量。本文讲清:窗口到底是什么、为什么不是越大越好、长上下文的三个真实坑、以及在 1M Token 时代你该怎么选模型。
🎯 本文导读
- 🔹 什么是上下文窗口(一句话定义)
- 🔹 主流模型当前的窗口大小对比
- 🔹 “上下文不等于记忆”——三大坑
- 🔹 长上下文 vs RAG,到底用哪个
- 🔹 普通人选模型的 3 条速查规则
一、📏 一句话定义:模型一次能”看到”的字数
上下文窗口 = 模型在生成下一个 Token 时,能同时参考的输入 + 输出 Token 总长度。
可以粗略换算:
| 单位 | 中文换算 | 英文换算 |
|---|---|---|
| 1 Token | ≈ 1.5 个汉字 | ≈ 0.75 个英文单词 |
| 8K Token | ≈ 一篇长公众号 | ≈ 5-6 页 A4 |
| 128K Token | ≈ 一本中篇小说 | ≈ 250 页 |
| 1M Token | ≈ 一整套《三体》 | ≈ 2000 页 |
💬 关键观点:窗口决定”上限”,不决定”质量”。窗口大 ≠ 记得清楚。
二、📊 主流模型窗口对比(2026 年)
| 模型 | 上下文窗口 | 真实能力 |
|---|---|---|
| GPT-5 | 400K | 长文召回稳 |
| Claude 4 Sonnet | 1M | 文档/代码场景王 |
| Gemini 2.5 Pro | 2M | 视频/多文档 |
| DeepSeek V3 | 128K | 性价比标杆 |
| Qwen3 | 128K-1M | 国内长文档 |
| Llama 4 | 10M(实验) | 学术里程碑 |
⚠️ 重要提醒:厂商宣传的窗口是”理论上限”。真正能稳定调用的有效窗口通常只有标称的 60-80%。
三、🕳 长上下文的三个坑
坑 1:Lost in the Middle(中段遗忘)
研究发现,模型对开头和结尾的内容记得最清楚,中间部分准确率会掉 30-50%。
💡 实操建议:把最重要的信息放开头或结尾,不要藏在中间。
坑 2:成本指数级上升
| 输入长度 | GPT-5 一次费用 |
|---|---|
| 4K | ≈ 0.01 美元 |
| 128K | ≈ 0.30 美元 |
| 1M | ≈ 2.5 美元 |
而且每多说一轮,前面所有内容都要重新计费。
坑 3:延迟变长
128K 输入大约要等 5-10 秒,1M 输入可能等 30-60 秒。日常对话场景,用户体验直接崩。
四、🤔 长上下文 vs RAG:到底用哪个?
这是 2026 年最常被问到的问题之一。我给你一张决策表:
| 场景 | 推荐方案 |
|---|---|
| 一次性问 1 个 PDF | 长上下文 |
| 知识库 1000 篇文档 | RAG |
| 客服系统、企业知识库 | RAG |
| 法律/合同/财报全文分析 | 长上下文 |
| 需要实时更新的资料 | RAG |
🎯 一句话总结:单次深读用长上下文,海量召回用 RAG。
RAG 是什么?后面 ep29 专门讲。
五、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ 窗口越大越聪明 | ✅ 推理质量由模型本身决定 |
| ❌ 把 100 万字塞进去就能问答 | ✅ 中段大概率被忽略 |
| ❌ 长上下文不要钱 | ✅ 每轮都按累计 Token 计费 |
| ❌ 长上下文能取代 RAG | ✅ 两者解决不同问题 |
六、🎁 普通人选模型 3 条速查规则
规则 1:日常对话 → 8K-32K 足够,选便宜的
规则 2:单文档分析 → 选 ≥128K 的模型(Claude / GPT-5)
规则 3:知识库问答 → 别堆窗口,搭 RAG
📮 今日话题:你用 AI 处理过最长的一份文档是多少页?它有没有”忘了你最初问的问题”?评论区聊聊。
🔮 下一篇预告:ep16《主流大模型横评:GPT / Claude / Gemini / DeepSeek / Qwen 到底选哪个?》——一张表选完,告别选择困难。
🟡 本系列是「小敏说 AI · AI 通识专栏」第 15 期。 关注公众号 小敏说 AI,回复「AI 入门」领取《打工人 AI 自救工具箱》。