🟡 多模态:模型如何看图、听声、读视频

三年前的 AI 只会”读字”。 今天的 AI,你递它一张照片,它能描述、对比、纠错、出报告。 这就是”多模态”——AI 真正开始”看世界”。

🟡 AI 通识专栏 · 第 18 期 📅 2026年7月9日 ✍️ 小敏说 AI

💡 本文要点:本文讲清多模态模型是什么、它怎么”看懂”图像和音视频、当前能做什么/不能做什么、五个适合普通人的多模态用法。


🎯 本文导读

  • 🔹 什么是多模态(一句话)
  • 🔹 它是怎么”看到”的(直觉版)
  • 🔹 主流多模态模型对比
  • 🔹 5 个能立刻用的真实场景
  • 🔹 它仍然搞不定的事

一、🌐 一句话定义

多模态(Multimodal)= 一个模型,能同时处理多种类型的输入: 文字、图像、音频、视频、表格、PDF、代码……

它把不同模态都”翻译”成同一种”语言”——向量,然后在同一个大脑里思考。

💬 关键观点:多模态的本质是”统一的表示空间“——猫的图、”猫”这个字、猫叫声,在模型里都接近同一个点。


二、👁 它是怎么”看到”图的(直觉版)

步骤 在干嘛
1 图片被切成几百块小图(Patch)
2 每块小图变成一个向量
3 这些向量和文字 Token 一起,喂给 Transformer
4 模型”读图”就像读字一样自然

⚠️ 重要提醒:模型并不是真的”看见”,它是在做模式匹配——但效果已经很接近”看见”了。


三、📊 主流多模态模型

模型 强项
GPT-5 图像理解 + 推理强
Claude 4 文档/图表/截图理解一流
Gemini 2.5 视频理解最强,能读 1 小时长视频
Qwen-VL 中文图像第一梯队
DeepSeek-VL 性价比之选

四、🎁 5 个普通人能立刻用的场景

1. 📷 截图问答

拍一张产品说明书 / 错误界面 / 设置面板,直接问”这是什么意思 / 怎么操作”。

2. 📊 图表解读

丢一张折线图、热力图、财报表,让它告诉你”重点是什么”。

3. 🍱 拍照算热量

拍一桌饭,让它估算总热量和宏量营养素分布。

4. 🧾 拍小票自动记账

直接生成 CSV / Excel 表。

5. 📺 看视频写总结

丢一段会议视频,AI 直接出 3 行要点 + 时间戳。

🎯 一句话总结:多模态最大的价值,是把”懒得整理的素材”变成”立刻能用的结构化结果”。


五、❌ 它仍然搞不定的事

任务 表现
数清图里有几个人 经常错
精确测量长度/角度 不靠谱
识别非常小的文字 大概率读错
看视频里的精细动作 还差很远
理解情绪/讽刺/表情包 偶尔 GET 偶尔翻车

⚠️ 涉及计数、测量、精细识别的任务,一定要人工校验。


六、🛠 多模态的”近未来”

  • 📱 手机摄像头实时对话(已经在做)
  • 🥽 AR 眼镜 + AI(Meta、Apple 已发布)
  • 🤖 具身智能机器人(看到 + 听到 + 行动)

💬 关键观点:当 AI 能”边看边说”的那天,人机交互方式会被重写一次。


七、🎁 给你的「多模态使用守则」

原则 1:能截图就别打字
原则 2:图表分析比口头描述准 10 倍
原则 3:涉及数字必须二次核对
原则 4:长视频选 Gemini,截图问答选 Claude / GPT

📮 今日话题:你试过把哪种”非文字内容”丢给 AI?它表现如何?

🔮 下一篇预告:第二阶段完结!下一篇正式进入 🟠 第三阶段:会用 AI。ep19《Prompt 工程:5 个让 AI 听话的万能结构》。


🟡 本系列是「小敏说 AI · AI 通识专栏」第 18 期(第二阶段完结)。 关注公众号 小敏说 AI,回复「AI 入门」领取《打工人 AI 自救工具箱》。