🟡 上下文窗口:为什么有的模型记性好,有的”金鱼脑”

你把一本 300 页的 PDF 丢给模型, 它要么”全文吃下”侃侃而谈,要么”看到后面忘了前面”。 决定它能不能记住的,是一个叫”上下文窗口”的东西。

🟡 AI 通识专栏 · 第 15 期 📅 2026年7月2日 ✍️ 小敏说 AI

💡 本文要点:上下文窗口(Context Window)是 LLM 一次能”看到”的 Token 总量。本文讲清:窗口到底是什么、为什么不是越大越好、长上下文的三个真实坑、以及在 1M Token 时代你该怎么选模型。


🎯 本文导读

  • 🔹 什么是上下文窗口(一句话定义)
  • 🔹 主流模型当前的窗口大小对比
  • 🔹 “上下文不等于记忆”——三大坑
  • 🔹 长上下文 vs RAG,到底用哪个
  • 🔹 普通人选模型的 3 条速查规则

一、📏 一句话定义:模型一次能”看到”的字数

上下文窗口 = 模型在生成下一个 Token 时,能同时参考的输入 + 输出 Token 总长度。

可以粗略换算:

单位 中文换算 英文换算
1 Token ≈ 1.5 个汉字 ≈ 0.75 个英文单词
8K Token ≈ 一篇长公众号 ≈ 5-6 页 A4
128K Token ≈ 一本中篇小说 ≈ 250 页
1M Token ≈ 一整套《三体》 ≈ 2000 页

💬 关键观点:窗口决定”上限”,不决定”质量”。窗口大 ≠ 记得清楚。


二、📊 主流模型窗口对比(2026 年)

模型 上下文窗口 真实能力
GPT-5 400K 长文召回稳
Claude 4 Sonnet 1M 文档/代码场景王
Gemini 2.5 Pro 2M 视频/多文档
DeepSeek V3 128K 性价比标杆
Qwen3 128K-1M 国内长文档
Llama 4 10M(实验) 学术里程碑

⚠️ 重要提醒:厂商宣传的窗口是”理论上限”。真正能稳定调用的有效窗口通常只有标称的 60-80%。


三、🕳 长上下文的三个坑

坑 1:Lost in the Middle(中段遗忘)

研究发现,模型对开头和结尾的内容记得最清楚,中间部分准确率会掉 30-50%。

💡 实操建议:把最重要的信息放开头或结尾,不要藏在中间。

坑 2:成本指数级上升

输入长度 GPT-5 一次费用
4K ≈ 0.01 美元
128K ≈ 0.30 美元
1M ≈ 2.5 美元

而且每多说一轮,前面所有内容都要重新计费。

坑 3:延迟变长

128K 输入大约要等 5-10 秒,1M 输入可能等 30-60 秒。日常对话场景,用户体验直接崩。


四、🤔 长上下文 vs RAG:到底用哪个?

这是 2026 年最常被问到的问题之一。我给你一张决策表:

场景 推荐方案
一次性问 1 个 PDF 长上下文
知识库 1000 篇文档 RAG
客服系统、企业知识库 RAG
法律/合同/财报全文分析 长上下文
需要实时更新的资料 RAG

🎯 一句话总结:单次深读用长上下文,海量召回用 RAG。

RAG 是什么?后面 ep29 专门讲。


五、❌ 常见误区

误区 真相
❌ 窗口越大越聪明 ✅ 推理质量由模型本身决定
❌ 把 100 万字塞进去就能问答 ✅ 中段大概率被忽略
❌ 长上下文不要钱 ✅ 每轮都按累计 Token 计费
❌ 长上下文能取代 RAG ✅ 两者解决不同问题

六、🎁 普通人选模型 3 条速查规则

规则 1:日常对话 → 8K-32K 足够,选便宜的
规则 2:单文档分析 → 选 ≥128K 的模型(Claude / GPT-5)
规则 3:知识库问答 → 别堆窗口,搭 RAG

📮 今日话题:你用 AI 处理过最长的一份文档是多少页?它有没有”忘了你最初问的问题”?评论区聊聊。

🔮 下一篇预告:ep16《主流大模型横评:GPT / Claude / Gemini / DeepSeek / Qwen 到底选哪个?》——一张表选完,告别选择困难。


🟡 本系列是「小敏说 AI · AI 通识专栏」第 15 期。 关注公众号 小敏说 AI,回复「AI 入门」领取《打工人 AI 自救工具箱》。