你的技术前沿之旅,从这里开始
视觉输入如何与语言模型对齐
对比学习让图文进入同一表示空间,多模态模型在此基础上再接入语言能力。

一、先对齐,再生成
CLIP 用大规模图文对做对比学习,把图像与文本映射到同一向量空间,并使用批内对比作为训练信号。在此之前,视觉模型与语言模型通常是两个独立系统,需要分别维护。
二、对齐之后要接生成
仅有相似度不足以生成描述,因此需要把视觉表示接入语言模型的输入或中间层。常见做法有两类:用视觉编码器输出作为语言模型的额外前缀,或用投影层把视觉特征映射到语言模型的嵌入空间。前者结构简单,后者在训练与扩展上更灵活。
三、分辨率与细节的取舍
图像被切分后送入编码器,切分尺寸直接影响细节保留。整图理解擅长场景与布局,局部裁剪擅长细节文字。两条路径的输出通常需要分别设计提示与评测集。
四、失败常出现在对齐层
切片顺序、缩放比例与投影维度都可能造成信息损失。出现"整体判断正确但细节读错"时,应先排查视觉表示链路,而不是直接调整提示。
五、可核对的来源
Learning Transferable Visual Models From Natural Language Supervision,arXiv:2103.00020。
六、适用边界
本文描述方法与结构选择,不涉及任何具体模型的公开评测分数。