👁️ 多模态模型的三条技术路线

3 年前,给 AI 一张图,它最多告诉你”这是一棵植物”。 现在,它能认出品种、浇水频率、光照需求,全程不到 5 秒。

🔬 AI 深度解析专栏 · 第 05 期 📅 2026年4月15日 ✍️ 小敏说 AI

💡 本文要点:多模态 AI 从”几乎看不懂图”到”图片视频全能”,背后有三条完全不同的技术路线。本文深度对比各路线优劣、实战 benchmark,并展望视频理解这个下一个大战场。


🎯 本文导读

  • 🔹 路线一:外挂式(给语言模型”配翻译”)
  • 🔹 路线二:原生融合(天生多模态)
  • 🔹 路线三:模块化管线(专业流水线)
  • 🔹 实战 benchmark 对比
  • 🔹 视频理解:下一个大战场

一、🛤️ 三条路线总览

先看全景图:

路线 核心思想 代表模型 简单类比
路线一:外挂式 语言模型 + 视觉编码器拼接 LLaVA, InternVL 给只懂中文的人配了个英文翻译
路线二:原生融合 从训练起就同时学文字和图像 Gemini, GPT-4o 天生双语的混血儿
路线三:模块化管线 专业模型各司其职,管线串联 某些 Agent 框架 工厂流水线

三条路各有优劣。


二、🔌 路线一:外挂式(Vision Encoder + LLM)

核心思路

已经有一个很强的语言模型了,只要想办法让它”看见”图片就行了。

具体方案:

  1. 用视觉编码器(CLIP、SigLIP、EVA 等)把图片转换成向量
  2. 用投影层(Projection Layer)把视觉向量”翻译”成语言模型能理解的格式
  3. 把翻译后的向量和文本一起喂给语言模型
图片 → [视觉编码器] → 视觉 Token → [投影层] → LLM 能理解的格式
                                                    ↓
文本输入 ───────────────────────────────→ [语言模型] → 输出回答

代表选手

  • LLaVA 系列:开源界的先驱,证明了这条路行得通
  • InternVL:上海 AI Lab 出品,中文多模态能力很强
  • Qwen-VL:阿里的方案,也走的这条路

优势 vs 劣势

优势:

  • 实现相对简单——有好的语言模型,加个视觉编码器就行
  • 可以复用最强的语言模型,视觉能力随底层模型升级而提升
  • 训练成本低——不需要从头训练,只需训练投影层和微调

劣势:

  • 视觉理解有上限——视觉信息是”翻译”过来的,不可避免丢失信息
  • 跨模态推理弱——图文之间的深层关系不容易捕捉
  • 支持图片容易,要加音频、视频需要额外编码器,越堆越复杂

就像给只懂中文的人配了个英文翻译——能通过翻译理解英语内容,但总有些微妙的意思会在翻译中丢失。

💬 关键观点:外挂式是”快速起步”的好方案,让已有语言模型快速获得视觉能力。但它的天花板由翻译质量决定,无法真正”理解”图像。


三、🧬 路线二:原生多模态(Native Multimodal)

核心思路

从一开始就让模型同时学习文字、图片、音频、视频,让多种模态在模型内部”自然融合”。

不需要外挂视觉编码器,不需要投影层。模型架构本身就能处理多种输入。

Google 的 Gemini 是最典型的例子。按照 Google 的说法,Gemini 从预训练阶段就同时学习了文本、图片、音频和视频数据,所有模态在同一个 Transformer 里”协同学习”。

GPT-4o 也走这条路——”o”代表”omni”(全能),输入可以是文字、图片、音频的任意组合。

关键技术细节

1. 统一的 Token 化 不管是文字、图片还是音频,都转化成 Token 序列。图片被分成小块(patches),每块变成一个 token;音频被分成短时间片段,每段变成 token。所有 token 混在一起输入 Transformer。

2. 跨模态注意力 图片 token 可以”看到”文字 token,文字 token 也可以”看到”图片 token。这种深层交互是原生融合的核心优势。

3. 大规模多模态预训练 需要海量图文对、视频文本对、音频文本对数据来训练,数据规模和多样性要求非常高。

优势 vs 劣势

优势:

  • 跨模态理解最深——图文音视频之间的关系是”自然学会”的
  • 统一架构优雅——一个模型搞定一切
  • 可能出现单模态模型没有的涌现能力

劣势:

  • 训练成本极高——需要从头训练,数据量和算力是天文数字
  • 升级一个模态的能力需要重新训练整个模型
  • 黑盒更黑——不同模态信息在内部如何交互,很难分析

💬 关键观点:原生融合是正确的长期方向,但门槛极高——只有 Google、OpenAI 这种有大量多模态数据积累的公司才真正跑通了这条路。


四、🏭 路线三:模块化管线(Modular Pipeline)

核心思路

不要把所有能力塞进一个模型,让专业的模型干专业的事,然后用管线把它们串起来。

用户输入(图片 + 文字)
    ├── 图片 → [OCR 模型] → 提取文字
    ├── 图片 → [目标检测模型] → 识别物体
    ├── 图片 → [描述生成模型] → 生成图片描述
    └── 所有结果汇总 → [语言模型] → 生成最终回答

优势 vs 劣势

优势:

  • 每个模块都可以是最强的——OCR 用最好的 OCR,检测用最好的检测器
  • 灵活可替换——任何模块升级了,直接换上去
  • 可解释性好——出了问题能定位到具体哪个模块
  • 成本可控——不需要的模块可以不启动

劣势:

  • 延迟高——每个模块串行处理,时间叠加
  • 信息损失——模块之间传递的是中间结果,可能丢失信息
  • 维护复杂——多个模型的版本管理、兼容性是个大问题

五、📊 三条路线实战对比

Benchmark Gemini 2.5 Pro(原生) GPT-4o(原生) InternVL 3(外挂) 管线方案
MMMU 74.2 72.8 68.5 ~60
MathVista 71.5 69.3 65.1 ~55
OCR 准确率 96.8% 95.2% 93.5% 98.1%
视频理解 82.3 78.5 有限支持 可扩展
响应延迟 中 中 低 高
训练成本 极高 极高 中 低

几个有意思的发现:

  1. 原生融合在综合理解上明显领先——MMMU 和 MathVista 需要同时理解图片和文字并做推理,正是原生融合的强项

  2. OCR 场景管线方案反而最好——专门的 OCR 模型在精确度上确实更强,这也说明”专精”有时候胜过”全能”

  3. 视频理解是原生融合的最大优势——外挂式和管线方案在视频理解上都比较吃力


六、🎬 视频理解:下一个大战场

视频理解可能是 2026-2027 年多模态 AI 最大的战场。

理解视频比理解图片难太多了。1 分钟视频,30fps 就有 1800 帧。不可能把每一帧都当图片喂给模型——token 数会爆炸。

目前主流方案:

  • 关键帧采样:从视频中抽取少量关键帧分析。简单但可能错过重要细节
  • 时间感知编码:把视频分成多个时间片段,每个片段提取特征后带上时间信息。Gemini 用了类似方法
  • 视频原生 Token 化:把视频直接编码成时空 token 序列,保留运动和时间信息。这是最前沿的方向

Google 在这个领域走得最远。Gemini 2.5 Pro 可以处理长达数小时的视频,理解情节发展、角色关系,甚至检测视频中的逻辑错误。不过,现在的视频理解水平离”真正看懂”还有不小差距。


七、🔮 未来走向

短期内三条路线会共存,但长期看原生融合会成为主流。

人类的认知就是原生多模态的——视觉、听觉、语言在大脑中同时处理、深度交互,而不是先”把看到的翻译成文字”再理解。

但这并不意味着其他路线会消亡:

  • 外挂式在开源社区和资源受限的场景中仍然很有价值
  • 管线方案在需要精确控制的工业场景(医疗影像、自动驾驶)中可能更合适

还有一个值得关注的趋势——多模态输出。现在大多数模型只能输出文字(少数能输出图片),但未来的模型可能能同时输出文字、图片、音频,甚至视频。GPT-4o 已经展示了一些音频输出能力,这个方向还有很大的想象空间。

🎯 一句话总结:三条路线对应三种不同的资源约束——钱足够就做原生融合,想快速落地就做外挂式,需要精确控制就做管线。选对路线比选对模型更重要。


七、🎯 多模态 AI 选型参考

如何选择适合自己的多模态技术路线?

需求场景 推荐技术路线 代表模型
资源充足,追求最高性能 路线三(原生融合) Gemini Ultra、GPT-4o
快速集成,时间成本优先 路线一(外挂插件) LLaVA、BLIP-2
工业流程,精确度要求高 路线二(管线式) 自定义多模型组合
视频理解、长视频分析 路线三 + 额外优化 Gemini 1.5 Pro
移动端多模态 路线一(轻量插件) MiniCPM-V、Qwen-VL

多模态模型评估时的注意事项:

  1. 别只看 MMMU 分数 — 综合基准不代表具体任务能力,复杂图表解读和自然场景理解差异很大
  2. 测试分布外样本 — 多模态模型在训练分布以外的图像上表现下降明显,务必用真实业务数据测试
  3. 关注幻觉率 — “图中有什么”和”图中没有什么”的能力不对称,模型容易凭空”看见”不存在的内容
  4. 视频理解单独测试 — 静态图像表现好不代表视频理解好,时序理解是独立的难题

⚠️ 重要提醒:多模态 AI 的”能力”往往是局部的。GPT-4o 看图很强,但在工业级 OCR 精度上可能还不如专用的文字识别模型。不要期待一个模型全能。


📮 今日话题

💬 你觉得视频理解 AI 最能改变哪个行业?

医疗影像、安防监控、影视创作、还是教育?你认为哪个场景的价值最大?欢迎留言。


🔬 本文属于「AI 深度解析」系列,每期一个主题,追本质不追热点。

🎙️ 想听更轻松的版本?我们的每日 AI 快讯播客有更口语化的解读。 📱 关注「小敏说 AI」公众号,深度解析不水文。