多模态模型
多模态模型可以同时处理文本、图片、音频、视频、表格、代码等多种信息形式。
核心知识点
重点掌握:
- 模态:文本、图像、音频、视频等输入或输出形式。
- 跨模态对齐:把不同模态映射到可共同理解的表示空间。
- 视觉语言模型:能理解图片并用文本回答问题的模型。
- OCR 和图像理解:识别文字只是第一步,还要理解布局、关系和语义。
- 多模态 RAG:检索图片、PDF、截图、表格、图文混合文档。
- 评估:不仅看文字答案,还要看定位、引用、识别准确率和推理质量。
多模态应用处理链路
多模态模型常见应用有哪些?
常见场景:
- 图片问答
- 截图理解
- 发票和合同识别
- 视频摘要
- 语音助手
- 医学影像辅助分析
- 工业质检
- UI 自动化和视觉 Agent
面试回答时可以补充:多模态不是简单 OCR,而是把视觉内容、文本信息和任务目标放在一起推理。
OCR 和多模态模型有什么区别?
OCR 主要负责从图片中识别文字。
多模态模型不仅能识别文字,还能理解:
- 图片中有哪些对象
- 对象之间的关系
- 表格和版面结构
- 截图中的 UI 状态
- 图文结合后的语义
例如一张报销单截图,OCR 能读出金额和日期,多模态模型还可以判断它是否符合报销规则。
多模态 RAG 怎么做?
常见做法:
- 对 PDF、图片、视频做解析。
- 提取文本、图片描述、表格、页面截图等信息。
- 分别建立文本向量、图片向量或多模态索引。
- 用户提问时检索相关文本和视觉片段。
- 把相关内容交给多模态模型生成答案。
难点:
- 图文对应关系容易丢失。
- 表格、流程图、截图需要保留结构。
- 大文件切分和引用定位更复杂。
- 评估不仅看答案,还要看引用是否来自正确区域。
多模态模型如何评估?
评估维度:
- 文字识别准确率
- 图片内容理解准确率
- 目标定位是否准确
- 图文推理是否正确
- 输出格式是否稳定
- 对低清晰度、遮挡、复杂版面的鲁棒性
- 是否会编造看不见的信息
生产环境里,关键字段抽取要有规则校验和人工复核。
多模态面试常见问题
多模态模型和纯文本模型有什么区别?
纯文本模型只处理文本 token,多模态模型可以同时理解图片、文本,甚至音频、视频等输入。它能回答图片内容、截图、图表、票据和页面相关问题。
工程难点不只是把图片传进去,还包括图片清晰度、坐标定位、表格结构、引用来源、隐私和评估。
OCR 和 VLM 有什么区别?
OCR 主要把图片中的文字识别出来,输出文本。VLM 不只识别文字,还能理解布局、图像内容、关系和上下文。
例如发票识别可以用 OCR 提取文字,再用规则或模型结构化;复杂图表解释、页面理解则更适合 VLM。实际项目中两者常组合使用。
多模态 RAG 如何构建?
多模态 RAG 通常先解析文档,把文本、图片、表格、页码和位置 metadata 提取出来,再分别做文本向量、图片向量或多模态 embedding。
查询时根据问题检索相关文本片段和视觉内容,组装上下文给模型回答,并返回引用页码或截图区域。关键是保留来源位置,否则答案难以验证。
如何处理 PDF 中的表格和图片?
PDF 解析要尽量保留结构。文本可以按段落和标题切分,表格可以提取成 Markdown 或结构化 JSON,图片要保存页码、区域和说明。
复杂 PDF 可能需要 OCR、版面分析和人工校验。面试时可以强调:不要把整份 PDF 粗暴转成长文本,否则表格关系和图片信息容易丢失。
多模态模型有哪些幻觉风险?
模型可能把看不清的内容说得很确定,也可能编造图片里不存在的对象、数字或关系。复杂表格、低清晰度截图、遮挡、反光、手写字都容易出错。
高风险场景要要求模型说明不确定性,并结合 OCR、规则校验、人工复核和引用区域来降低风险。
图片输入会带来哪些安全问题?
图片可能包含隐私信息,例如身份证、合同、地址、账号,也可能包含隐藏文本或 Prompt Injection。上传图片还会带来文件类型、大小和恶意文件风险。
工程上要做权限校验、内容脱敏、文件扫描、访问控制、日志脱敏和输入隔离。模型看到的图片内容也应视为不可信上下文。
如何评估图像问答是否正确?
可以从识别准确率、字段抽取准确率、答案正确率、引用位置、拒答能力和人工评审几个维度评估。对于票据、表格、截图类任务,可以准备标注集逐项对比。
开放式视觉问答还要看模型是否承认不确定、是否编造看不见的信息。上线后要持续收集 bad case。
回答时可以强调:多模态系统的难点通常在解析、结构保留、引用定位和评估,而不是只把图片传给模型。