多模态大模型接入(Multimodal LLM)

多模态大模型指能同时理解多种模态(图像、音频、视频,乃至文档/表格)并统一用文本产出结果的模型。接入它,就是让 Agent 不再只看得见文字,而能”看图、听声、懂视频”,再把多模态信息转成文本管线里的证据或动作。

一句话类比:纯文本模型像”只读文字报告的分析师”;多模态模型像”既看现场照片、又听录音、还能看监控视频,最后用文字写出结论”的现场调查员。接入多模态,就是给 Agent 装上眼睛和耳朵,但最终汇报仍用文字。

关联:多模态理解底层依赖 Embedding(把图像/语音编码成向量),见 embedding_model.md;模型”动手干活”仍靠 Tool Calling,见 tool_calling.md;要接这类能力也常用 MCP,见 mcp.md

1. 为什么需要它:文本装不下真实世界

用户的问题常常不在文字里——一张截图里的报错、一段会议录音、一个产品演示视频。纯文本 LLM 看不到这些,只能让用户费力”打字描述”。多模态模型直接吃原始信号,省去”人肉转写/描述”这一步,也避免了描述失真。

图像 / 音频 / 视频
   │
   ▼ 编码器(Vision/ASR/Video Encoder)编码成向量
[多模态 LLM] 与文本 token 对齐到同一空间
   │
   ▼ 统一用文本输出:描述 / 回答 / 抽取的结构化结果 / tool_call

2. 核心模态与典型模型

模态任务代表能力 / 模型思路
视觉 (Vision-Language, VLM)看图问答、OCR、图表理解、截图定位图像编码器(如 ViT) + 投影层对齐到 LLM;Qwen-VL、GPT-4o、Claude 等
音频 (ASR + 理解)语音转写、会议摘要、声音情感Whisper 类做 ASR,再交 LLM 理解;或直接语音模型
视频视频描述、关键帧抽取、长视频问答逐帧/采帧编码 + 时序聚合,再进 LLM
文档/表格扫描件、PDF、Excel 理解版式 OCR + 多模态联合理解

关键点:各模态先由专门的编码器变成向量,再投影到 LLM 的文本嵌入空间,于是 LLM 能像读文字一样”读”图/音/视频,输出仍是普通文本(或 tool call)。

3. 接入方式

  • 原生多模态端点:直接把图片/音频 base64 或 URL 随消息发过去(OpenAI 兼容的 content 数组里放 image_url / input_audio)。
  • 分离式管线:先用独立模型转写(Whisper 转文字、OCR 提文本),再把文本喂给纯文本 LLM——成本低、可控,但丢掉非文字信息(图里的布局、语气)。
  • MCP / 工具:把”看图片""听音频”封装成工具,让 Agent 按需调用(见 mcp.md 的 Playwright/文件类思路)。

4. 基本用法(VLM 调用示意)

# 以 OpenAI 兼容的多模态消息为例:让模型"看"一张报错截图
from openai import OpenAI
client = OpenAI()
 
resp = client.chat.completions.create(
    model="gpt-4o",           # 原生多模态模型
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这张截图里的报错是什么原因?怎么修?"},
            {"type": "image_url", "image_url": {"url": "https://.../error.png"}},
        ],
    }],
)
print(resp.choices[0].message.content)
# 音频:先把语音转写,再理解(分离式,省多模态额度)
import whisper
text = whisper.load_model("base").transcribe("meeting.mp3")["text"]
# → 把 text 交给普通 LLM 做摘要/问答

5. 典型工作流

  1. 明确要处理哪种模态(图/音/视频/文档),选对应模型或编码管线。
  2. 选接入形态:原生多模态端点(保真)vs 先转写再文本 LLM(省钱)。
  3. 把多模态结果作为证据拼进上下文(见 context_engineering.md),或转成结构化输出驱动后续 tool。
  4. 评测:图像问答看准确率、音频看转写词错率(WER)、端到端看任务完成度。

6. 常见误区

  • ❌ “多模态 = 模型自己会所有事” → 视频理解常是采帧近似,长视频/高帧率仍吃算力;复杂视频推理可能要先抽关键帧再分析。
  • ❌ “全都用原生多模态端点最省事” → 对纯语音/纯 OCR 场景,先用 Whisper/OCR 转文本再交文本 LLM 更便宜可控,且结果可审计。
  • ❌ “丢张图模型就懂版式” → 表格/扫描件需要版式感知的多模态或专用文档模型,通用 VLM 对复杂版式仍会错。
  • ❌ “多模态输出不再是文本” → 接入 Agent 时,多模态模型的输出仍走文本/tool_call,多模态主要解决”输入”侧;真正”动手”(下载、回复)靠工具,见 tool_calling.md

7. 心理学的”多模态”:和人类多感官整合的关系

你可能会想:心理学/认知科学里也常说”多模态感知”,它和我们刚才说的 AI 多模态是一回事吗?简短回答:是”同名类比”,机制完全不同,但 AI 多模态这个概念确实借自心理学。

心理学里的多模态 = 多感官整合 (Multisensory Integration)

人脑天然把多个感觉通道的信息融合起来理解世界:视觉、听觉、触觉(haptic)、嗅觉、本体感觉等。它不是一个”看图的模型”,而是在身体里、在世界中边行动边整合。

经典现象:

  • McGurk 效应:人看别人说话的嘴型,会”听错”声音(嘴型”ga”配声音”ba”,人听到”da”)——说明感知是被视觉重构的,不是单纯把声音加进去。
  • 腹语者效应:声音明明从一侧喇叭来,但你看到前方的”说话人”,就觉得声音来自他——视觉”捕获”了听觉的位置
  • 冗余增益 / 逆效性:多个通道一起给信号时,人比单通道更快更准地察觉,尤其是每个通道单独都很弱的时候。

认知科学里有个核心难题叫绑定问题 (binding problem):脑怎么把”正确的视觉”和”正确的声音”对应到一起(而不是乱配)。

和 AI 多模态的关联(类比 + 启发)

维度人类多感官整合AI 多模态
通道眼/耳/皮肤等真实感官图像/音频/视频 encoder(ViT、Whisper…)
融合目标融成统一感知,消歧、鲁棒投影到共享嵌入空间,融成统一表征再输出
怎么”对齐”发育中通过身体行动自然学会配对数据(图+文)联合训练学会
绑定问题脑如何不配错AI 用”图文对”联合训练近似解决

思路是同构的:不同通道 → 编码 → 融合成统一表征 → 更好决策。认知科学的”跨模态对齐、联想学习”也确实启发了 AI 架构(如 CLIP 式的对比学习,就类似”把相关的图与文关联起来”的联想)。

关键差异(别画等号)

  • 具身 vs 非具身:人类的”多模态”是具身 (embodied) 的——婴儿学”苹果”是同时看、摸、尝、听,概念扎根在身体经验里;AI 没有身体、没有真实感官,只是统计性地对齐表征。
  • 机制不同:人类整合是生物神经的、发展性的、双向无缝的,且常是”重构式”感知(McGurk);AI 是把分离 encoder 的输出投到一个学到的向量空间里做融合,本质是统计表征对齐,不是理解。
  • 时间/因果:人类能沿时间、因果把多模态串起来;当前 AI 多模态多是对静态片段编码再融合,时序/因果整合仍弱。

一句话:AI 说自己是”多模态”,是借了心理学的词做类比——目标相似(融合多通道、更鲁棒),但底层一个是生物认知、一个是统计学习。把它当成”受心理学启发的隐喻”最准确,别当成”机器真的在像人一样感知”。

8. 延伸阅读 / 关联概念

  • Embedding 模型 — 图像/语音编码成向量的基础;见 embedding_model.md
  • Tool Calling — 多模态结果驱动动作的统一出口;见 tool_calling.md
  • MCP — 把”看图/听音”封装成可复用工具;见 mcp.md
  • 上下文工程 — 多模态证据如何拼进上下文;见 context_engineering.md
  • RAG 优化 — 多模态检索(以图搜图/视频片段召回)是 RAG 的多模态延伸;见 rag_optimization.md