人工智能前沿技术解读 · 按栏目浏览全部文章

寻想集团-超级人工智能有限公司全部文章

你的技术前沿之旅,从这里开始

视觉输入如何与语言模型对齐

对比学习让图文进入同一表示空间,多模态模型在此基础上再接入语言能力。

黑色台面上放着镜头模组与小块电路板,边缘被一道暖黄色轮廓光勾出,细节清晰。
视觉输入与编码流程示意。

一、先对齐,再生成

CLIP 用大规模图文对做对比学习,把图像与文本映射到同一向量空间,并使用批内对比作为训练信号。在此之前,视觉模型与语言模型通常是两个独立系统,需要分别维护。

二、对齐之后要接生成

仅有相似度不足以生成描述,因此需要把视觉表示接入语言模型的输入或中间层。常见做法有两类:用视觉编码器输出作为语言模型的额外前缀,或用投影层把视觉特征映射到语言模型的嵌入空间。前者结构简单,后者在训练与扩展上更灵活。

三、分辨率与细节的取舍

图像被切分后送入编码器,切分尺寸直接影响细节保留。整图理解擅长场景与布局,局部裁剪擅长细节文字。两条路径的输出通常需要分别设计提示与评测集。

四、失败常出现在对齐层

切片顺序、缩放比例与投影维度都可能造成信息损失。出现"整体判断正确但细节读错"时,应先排查视觉表示链路,而不是直接调整提示。

五、可核对的来源

Learning Transferable Visual Models From Natural Language Supervision,arXiv:2103.00020。

六、适用边界

本文描述方法与结构选择,不涉及任何具体模型的公开评测分数。