第 13 章 · 大模型算法岗
多模态大模型
覆盖视觉编码、模态对齐、融合、训练、幻觉与多模态评测。
视觉语言模型通常由哪些部分组成?
30 秒口述版
常见结构含视觉编码器、连接/投影模块和语言模型,把图像特征映射到语言可消费的表示。
原理与推导
组件可冻结或联合训练,融合位置决定计算与对齐能力。
公式、代码或工程案例
画出 image→encoder→projector→LLM。
高频追问
- Q-Former 起什么作用?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要把图像简单等同于一个 token。
权威来源
图像如何变成视觉 Token?
30 秒口述版
ViT 把图像切 patch,经线性投影和位置编码得到序列;分辨率越高 token 越多。
原理与推导
动态切图、区域裁剪与 token 压缩用于兼顾细节和成本。
公式、代码或工程案例
估算 H×W 图像在 patch size P 下的 token 数。
高频追问
- 非方形图像怎样处理?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要忽略 resize 对小字和几何的破坏。
权威来源
模态连接器有哪些形式?
30 秒口述版
线性/MLP projector 简单高效,Q-Former 用可学习查询压缩视觉信息,cross-attention 可做更深交互。
原理与推导
选择取决于冻结策略、token 预算和任务复杂度。
公式、代码或工程案例
在相同视觉 encoder 下做 connector 消融。
高频追问
- 为什么仅训练 projector 也能工作?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要把连接器参数少等同于信息无损。
权威来源
多模态预训练与指令微调如何衔接?
30 秒口述版
先用图文对齐或生成任务连接模态,再用多模态指令数据学习问答与交互格式。
原理与推导
数据需覆盖定位、OCR、推理和拒答,避免只学描述模板。
公式、代码或工程案例
分阶段冻结/解冻并监控语言能力回退。
高频追问
- 纯文本数据为何仍要混入?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要用测试图像生成训练问答。
权威来源
多模态幻觉为什么发生?
30 秒口述版
视觉信息不足、连接器丢失、语言先验过强或训练标注噪声都可能让模型描述不存在对象。
原理与推导
应结合目标检测式证据、对比样本、拒答和视觉 grounding 评测。
公式、代码或工程案例
对遮挡、空图和反事实图像做测试。
高频追问
- 对象幻觉与关系幻觉如何区分?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要只用流畅描述评价。
权威来源
OCR 与文档理解为什么困难?
30 秒口述版
小字、布局、阅读顺序、分辨率和长页面同时挑战视觉编码与语言推理。
原理与推导
高分辨率切片、布局坐标和专用 OCR 工具可与模型协同。
公式、代码或工程案例
分别测文本识别、表格结构和跨页推理。
高频追问
- 端到端 VLM 何时优于 OCR pipeline?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要用降采样后的整页图判断 OCR 能力。
权威来源
多模态模型怎样评测?
30 秒口述版
按感知、OCR、定位、知识、推理和安全分层,并检查题目泄漏与裁判偏差。
原理与推导
自动选择题易测但覆盖有限,开放回答需人工或校准裁判。
公式、代码或工程案例
报告不同分辨率与输入预算下结果。
高频追问
- 图像顺序会影响多图推理吗?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要把单一综合榜当生产结论。
