视觉语言模型可以先被理解成一条信息通道:图像被视觉编码器压缩为一组表示,再经过连接模块进入语言模型能够处理的空间,最终参与自回归预测。

视觉 token 从哪里来

常见视觉编码器会把图像切成 patch,并将每个 patch 映射为向量。经过多层注意力计算后,这些向量不再只描述局部像素,而会携带对象、位置和语义关系。

高分辨率输入会带来更多视觉 token。它能保留细节,但也会显著增加后续语言模型的上下文长度和计算成本,因此 token 压缩与动态分辨率一直是重要问题。

为什么需要连接模块

视觉编码器与语言模型通常来自不同的预训练目标,两者的表示分布并不天然一致。线性投影、多层感知机、查询式 Transformer 等连接模块,承担把视觉特征翻译到语言模型输入空间的任务。

连接模块越复杂不一定越好。真正关键的是训练数据和目标能否提供足够清晰的跨模态监督,让视觉信息在生成答案时被实际使用。

下一步学习路径

接下来会依次整理视觉指令微调、分辨率策略、幻觉评测与多模态推理。每篇笔记都会保留概念、公式、代码实验和未解决问题四个部分。