🔬 多模态模型的三条技术路线:谁能真正「看懂」世界?
👁️ 多模态模型的三条技术路线
3 年前,给 AI 一张图,它最多告诉你”这是一棵植物”。 现在,它能认出品种、浇水频率、光照需求,全程不到 5 秒。
🔬 AI 深度解析专栏 · 第 05 期 📅 2026年4月15日 ✍️ 小敏说 AI
💡 本文要点:多模态 AI 从”几乎看不懂图”到”图片视频全能”,背后有三条完全不同的技术路线。本文深度对比各路线优劣、实战 benchmark,并展望视频理解这个下一个大战场。
🎯 本文导读
- 🔹 路线一:外挂式(给语言模型”配翻译”)
- 🔹 路线二:原生融合(天生多模态)
- 🔹 路线三:模块化管线(专业流水线)
- 🔹 实战 benchmark 对比
- 🔹 视频理解:下一个大战场
一、🛤️ 三条路线总览
先看全景图:
| 路线 | 核心思想 | 代表模型 | 简单类比 |
|---|---|---|---|
| 路线一:外挂式 | 语言模型 + 视觉编码器拼接 | LLaVA, InternVL | 给只懂中文的人配了个英文翻译 |
| 路线二:原生融合 | 从训练起就同时学文字和图像 | Gemini, GPT-4o | 天生双语的混血儿 |
| 路线三:模块化管线 | 专业模型各司其职,管线串联 | 某些 Agent 框架 | 工厂流水线 |
三条路各有优劣。
二、🔌 路线一:外挂式(Vision Encoder + LLM)
核心思路
已经有一个很强的语言模型了,只要想办法让它”看见”图片就行了。
具体方案:
- 用视觉编码器(CLIP、SigLIP、EVA 等)把图片转换成向量
- 用投影层(Projection Layer)把视觉向量”翻译”成语言模型能理解的格式
- 把翻译后的向量和文本一起喂给语言模型
图片 → [视觉编码器] → 视觉 Token → [投影层] → LLM 能理解的格式
↓
文本输入 ───────────────────────────────→ [语言模型] → 输出回答
代表选手
- LLaVA 系列:开源界的先驱,证明了这条路行得通
- InternVL:上海 AI Lab 出品,中文多模态能力很强
- Qwen-VL:阿里的方案,也走的这条路
优势 vs 劣势
优势:
- 实现相对简单——有好的语言模型,加个视觉编码器就行
- 可以复用最强的语言模型,视觉能力随底层模型升级而提升
- 训练成本低——不需要从头训练,只需训练投影层和微调
劣势:
- 视觉理解有上限——视觉信息是”翻译”过来的,不可避免丢失信息
- 跨模态推理弱——图文之间的深层关系不容易捕捉
- 支持图片容易,要加音频、视频需要额外编码器,越堆越复杂
就像给只懂中文的人配了个英文翻译——能通过翻译理解英语内容,但总有些微妙的意思会在翻译中丢失。
💬 关键观点:外挂式是”快速起步”的好方案,让已有语言模型快速获得视觉能力。但它的天花板由翻译质量决定,无法真正”理解”图像。
三、🧬 路线二:原生多模态(Native Multimodal)
核心思路
从一开始就让模型同时学习文字、图片、音频、视频,让多种模态在模型内部”自然融合”。
不需要外挂视觉编码器,不需要投影层。模型架构本身就能处理多种输入。
Google 的 Gemini 是最典型的例子。按照 Google 的说法,Gemini 从预训练阶段就同时学习了文本、图片、音频和视频数据,所有模态在同一个 Transformer 里”协同学习”。
GPT-4o 也走这条路——”o”代表”omni”(全能),输入可以是文字、图片、音频的任意组合。
关键技术细节
1. 统一的 Token 化 不管是文字、图片还是音频,都转化成 Token 序列。图片被分成小块(patches),每块变成一个 token;音频被分成短时间片段,每段变成 token。所有 token 混在一起输入 Transformer。
2. 跨模态注意力 图片 token 可以”看到”文字 token,文字 token 也可以”看到”图片 token。这种深层交互是原生融合的核心优势。
3. 大规模多模态预训练 需要海量图文对、视频文本对、音频文本对数据来训练,数据规模和多样性要求非常高。
优势 vs 劣势
优势:
- 跨模态理解最深——图文音视频之间的关系是”自然学会”的
- 统一架构优雅——一个模型搞定一切
- 可能出现单模态模型没有的涌现能力
劣势:
- 训练成本极高——需要从头训练,数据量和算力是天文数字
- 升级一个模态的能力需要重新训练整个模型
- 黑盒更黑——不同模态信息在内部如何交互,很难分析
💬 关键观点:原生融合是正确的长期方向,但门槛极高——只有 Google、OpenAI 这种有大量多模态数据积累的公司才真正跑通了这条路。
四、🏭 路线三:模块化管线(Modular Pipeline)
核心思路
不要把所有能力塞进一个模型,让专业的模型干专业的事,然后用管线把它们串起来。
用户输入(图片 + 文字)
├── 图片 → [OCR 模型] → 提取文字
├── 图片 → [目标检测模型] → 识别物体
├── 图片 → [描述生成模型] → 生成图片描述
└── 所有结果汇总 → [语言模型] → 生成最终回答
优势 vs 劣势
优势:
- 每个模块都可以是最强的——OCR 用最好的 OCR,检测用最好的检测器
- 灵活可替换——任何模块升级了,直接换上去
- 可解释性好——出了问题能定位到具体哪个模块
- 成本可控——不需要的模块可以不启动
劣势:
- 延迟高——每个模块串行处理,时间叠加
- 信息损失——模块之间传递的是中间结果,可能丢失信息
- 维护复杂——多个模型的版本管理、兼容性是个大问题
五、📊 三条路线实战对比
| Benchmark | Gemini 2.5 Pro(原生) | GPT-4o(原生) | InternVL 3(外挂) | 管线方案 |
|---|---|---|---|---|
| MMMU | 74.2 | 72.8 | 68.5 | ~60 |
| MathVista | 71.5 | 69.3 | 65.1 | ~55 |
| OCR 准确率 | 96.8% | 95.2% | 93.5% | 98.1% |
| 视频理解 | 82.3 | 78.5 | 有限支持 | 可扩展 |
| 响应延迟 | 中 | 中 | 低 | 高 |
| 训练成本 | 极高 | 极高 | 中 | 低 |
几个有意思的发现:
-
原生融合在综合理解上明显领先——MMMU 和 MathVista 需要同时理解图片和文字并做推理,正是原生融合的强项
-
OCR 场景管线方案反而最好——专门的 OCR 模型在精确度上确实更强,这也说明”专精”有时候胜过”全能”
-
视频理解是原生融合的最大优势——外挂式和管线方案在视频理解上都比较吃力
六、🎬 视频理解:下一个大战场
视频理解可能是 2026-2027 年多模态 AI 最大的战场。
理解视频比理解图片难太多了。1 分钟视频,30fps 就有 1800 帧。不可能把每一帧都当图片喂给模型——token 数会爆炸。
目前主流方案:
- 关键帧采样:从视频中抽取少量关键帧分析。简单但可能错过重要细节
- 时间感知编码:把视频分成多个时间片段,每个片段提取特征后带上时间信息。Gemini 用了类似方法
- 视频原生 Token 化:把视频直接编码成时空 token 序列,保留运动和时间信息。这是最前沿的方向
Google 在这个领域走得最远。Gemini 2.5 Pro 可以处理长达数小时的视频,理解情节发展、角色关系,甚至检测视频中的逻辑错误。不过,现在的视频理解水平离”真正看懂”还有不小差距。
七、🔮 未来走向
短期内三条路线会共存,但长期看原生融合会成为主流。
人类的认知就是原生多模态的——视觉、听觉、语言在大脑中同时处理、深度交互,而不是先”把看到的翻译成文字”再理解。
但这并不意味着其他路线会消亡:
- 外挂式在开源社区和资源受限的场景中仍然很有价值
- 管线方案在需要精确控制的工业场景(医疗影像、自动驾驶)中可能更合适
还有一个值得关注的趋势——多模态输出。现在大多数模型只能输出文字(少数能输出图片),但未来的模型可能能同时输出文字、图片、音频,甚至视频。GPT-4o 已经展示了一些音频输出能力,这个方向还有很大的想象空间。
🎯 一句话总结:三条路线对应三种不同的资源约束——钱足够就做原生融合,想快速落地就做外挂式,需要精确控制就做管线。选对路线比选对模型更重要。
七、🎯 多模态 AI 选型参考
如何选择适合自己的多模态技术路线?
| 需求场景 | 推荐技术路线 | 代表模型 |
|---|---|---|
| 资源充足,追求最高性能 | 路线三(原生融合) | Gemini Ultra、GPT-4o |
| 快速集成,时间成本优先 | 路线一(外挂插件) | LLaVA、BLIP-2 |
| 工业流程,精确度要求高 | 路线二(管线式) | 自定义多模型组合 |
| 视频理解、长视频分析 | 路线三 + 额外优化 | Gemini 1.5 Pro |
| 移动端多模态 | 路线一(轻量插件) | MiniCPM-V、Qwen-VL |
多模态模型评估时的注意事项:
- 别只看 MMMU 分数 — 综合基准不代表具体任务能力,复杂图表解读和自然场景理解差异很大
- 测试分布外样本 — 多模态模型在训练分布以外的图像上表现下降明显,务必用真实业务数据测试
- 关注幻觉率 — “图中有什么”和”图中没有什么”的能力不对称,模型容易凭空”看见”不存在的内容
- 视频理解单独测试 — 静态图像表现好不代表视频理解好,时序理解是独立的难题
⚠️ 重要提醒:多模态 AI 的”能力”往往是局部的。GPT-4o 看图很强,但在工业级 OCR 精度上可能还不如专用的文字识别模型。不要期待一个模型全能。
📮 今日话题
💬 你觉得视频理解 AI 最能改变哪个行业?
医疗影像、安防监控、影视创作、还是教育?你认为哪个场景的价值最大?欢迎留言。
🔬 本文属于「AI 深度解析」系列,每期一个主题,追本质不追热点。
🎙️ 想听更轻松的版本?我们的每日 AI 快讯播客有更口语化的解读。 📱 关注「小敏说 AI」公众号,深度解析不水文。