基于自然语言监督学习可迁移的视觉模型 (CLIP)

基本信息

项目内容
作者Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever (OpenAI)
年份2021 (ICML 2021)
来源Proceedings of the 38th International Conference on Machine Learning (PMLR 139: 8748-8763, 2021) / GitHub: OpenAI/CLIP
主题对比语言-图像预训练与零样本视觉迁移 (Contrastive Language-Image Pre-training)
链接Fulltext Markdown · Zotero 条目 · Zotero PDF · arXiv:2103.00020

一句话摘要

针对传统计算机视觉系统受限于人工预定义封闭类别标签且难以泛化的问题,OpenAI 提出 CLIP 框架,直接在互联网爬取的 4 亿图文对上利用双塔对比学习(Contrastive Pre-training)预测图文匹配,将自然语言的开放语义与图像像素特征绑定在统一单位超球面上,实现了无需微调即可灵活零样本迁移至任意下游视觉任务的全新范式。

研究对象

  • 研究对象:现实世界中开放视觉概念与自然语言描述之间的跨模态语义映射。
  • 核心问题:经典深度视觉模型采用 1-of-N 固化多分类 Softmax 头,训练数据依赖耗资巨大的专业人工标定(如 ImageNet),且模型泛化性差、无法理解训练集之外的新概念;而自然语言中包含无所不包的弱监督世界知识,如何利用计算高效的无监督/自监督目标,从海量网络图文对中直接端到端学习开放视觉表征。
  • 研究情境/范围:在覆盖通用物体分类(ImageNet)、细粒度动植物分类(Oxford-Pets, Flowers102)、OCR 文本识别、航拍遥感、地理定位、视频动作识别等 30 多个权威视觉基准以及多个对抗性分布偏移数据集(ImageNet-A, ImageNet-R, ImageNet-Sketch)上进行全面零样本与线性探测评测。

研究方法

方法概述

  • 方法类型:大规模多模态自监督对比预训练 + 提示工程驱动的零样本推理 + 全面实证基准评测。
  • 总体思路:
    1. 海量网络图文数据集构建(WIT):通过 50 万个 Wikipedia 高频词和短语过滤构建 4 亿互联网图文对(WebImageText, WIT),在规模上追平大规模文本预训练语料;
    2. 高效对比对齐代理任务:摈弃逐词生成的自回归语言建模(运算开销大且难以收敛),采用双塔对比学习架构(Image Encoder + Text Encoder);
    3. 双向对称交叉熵损失:在每个大小为 NN 的 Batch 中,最大化 NN 对真实图文正样本的余弦相似度,同时抑制其余 N2−NN^2 - N 对负样本相似度;
    4. 零样本分类器动态合成:在测试阶段,将数据集中的类别名填入预设提示模板(如 "A photo of a {label}."),通过文本编码器生成各类的权重向量,作为零样本线性分类器与图像特征点乘,选取最高概率标签。
  • 为什么用这种方法:实验证明对比式代理任务的训练效率比自回归生成式高出 4 倍以上,比词袋预测快 3 倍,能在大规模并行 GPU 上实现极佳的计算缩放性(Compute Scaling)。

方法分析

  • 分析单位:图文配对样本对 (Ii,Ti)(\mathbf{I}_i, \mathbf{T}_i),特征维度为 ded_e。
  • 关键变量/概念:
    • 图像编码器 fimg(⋅)f_{\text{img}}(\cdot)(ResNet 或 Vision Transformer ViT);
    • 文本编码器 ftxt(⋅)f_{\text{txt}}(\cdot)(标准 Transformer);
    • L2L_2 归一化多模态嵌入向量:I^i=Wifimg(Ii)∥⋅∥2\hat{\mathbf{I}}_i = \frac{\mathbf{W}_i f_{\text{img}}(\mathbf{I}_i)}{\|\cdot\|_2},T^j=Wtftxt(Tj)∥⋅∥2\hat{\mathbf{T}}_j = \frac{\mathbf{W}_t f_{\text{txt}}(\mathbf{T}_j)}{\|\cdot\|_2};
    • 可学习温度系数 τ\tau(参数化为 exp⁡(t)\exp(t));
    • 余弦相似度矩阵 Sij=I^i⊤T^j\mathbf{S}_{ij} = \hat{\mathbf{I}}_i^\top \hat{\mathbf{T}}_j。
  • 识别/推断逻辑:
    • 图像与其正确标题应当在隐空间中距离最近,而与其他无关文本在欧氏超球面上正交分散;
    • 提示词工程(Prompt Engineering)如 "a photo of a {label}" 能够消除词义歧义(例如区分作为施工工具的 "crane" 与鸟类 "crane"),显著提升零样本准确率。
  • 具体步骤:
    1. 图像经过随机方形裁剪增强,文本通过 BPE 分词并截断至最大长度 76;
    2. 分别提取图像与文本表征,通过线性投影映射到统一多模态嵌入空间并做 L2L_2 归一化;
    3. 计算 N×NN \times N 配对相似度并乘上缩放系数 exp⁡(t)\exp(t);
    4. 分别沿图像轴与文本轴计算交叉熵损失并取平均;
    5. 采用 AdamW 与 Cosine 衰减调度优化。

  • 核心公式/指标 1:对称双向多模态 InfoNCE 损失函数 (Symmetric Cross-Entropy Loss)
LI=−1N∑i=1Nlog⁡exp⁡(I^i⊤T^i/τ)∑j=1Nexp⁡(I^i⊤T^j/τ)\mathcal{L}_I = -\frac{1}{N} \sum_{i=1}^N \log \frac{\exp(\hat{\mathbf{I}}_i^\top \hat{\mathbf{T}}_i / \tau)}{\sum_{j=1}^N \exp(\hat{\mathbf{I}}_i^\top \hat{\mathbf{T}}_j / \tau)} LT=−1N∑j=1Nlog⁡exp⁡(I^j⊤T^j/τ)∑i=1Nexp⁡(I^i⊤T^j/τ)\mathcal{L}_T = -\frac{1}{N} \sum_{j=1}^N \log \frac{\exp(\hat{\mathbf{I}}_j^\top \hat{\mathbf{T}}_j / \tau)}{\sum_{i=1}^N \exp(\hat{\mathbf{I}}_i^\top \hat{\mathbf{T}}_j / \tau)} L=12(LI+LT)\mathcal{L} = \frac{1}{2} (\mathcal{L}_I + \mathcal{L}_T)
  • 公式拆解 1:
    • 这条公式表示什么:在每个大小为 NN 的小批量中,同时优化“以图找文”与“以文找图”两个方向的检索匹配概率,迫使图文在多模态几何空间中严格对齐。
    • 其中关键符号分别代表什么:I^i\hat{\mathbf{I}}_i 与 T^j\hat{\mathbf{T}}_j 分别为经过线性投影与 L2L_2 归一化的单位图像与文本特征向量;I^i⊤T^j\hat{\mathbf{I}}_i^\top \hat{\mathbf{T}}_j 等价于两者的余弦相似度;τ\tau 为可自适应调节 logit 动态范围的连续温度参数;NN 为批次大小(实验中设为 32,768 超大 Batch)。
    • 这条公式对应方法中的哪一步:CLIP 预训练的核心目标函数。

  • 核心公式/指标 2:零样本分类后验概率打分算子 (Zero-Shot Classifier Formulation)
p(y=k∣I)=exp⁡(cos⁡(fimg(I),wk)/τ)∑j=1Kexp⁡(cos⁡(fimg(I),wj)/τ)p(y = k \mid \mathbf{I}) = \frac{\exp(\cos(f_{\text{img}}(\mathbf{I}), \mathbf{w}_k) / \tau)}{\sum_{j=1}^K \exp(\cos(f_{\text{img}}(\mathbf{I}), \mathbf{w}_j) / \tau)}
  • 公式拆解 2:
    • 这条公式表示什么:利用预训练文本编码器将 KK 个类别提示语句转换为一组分类器超平面法向量 wk=ftxt(Prompt(classk))\mathbf{w}_k = f_{\text{txt}}(\text{Prompt}(\text{class}_k)),直接计算图像与各类别文本嵌入的 Softmax 概率。
    • 其中关键符号分别代表什么:wk\mathbf{w}_k 即为动态生成的第 kk 类零样本分类权重;cos⁡(⋅,⋅)\cos(\cdot, \cdot) 为余弦相似度;KK 为目标数据集的类别总数。
    • 这条公式对应方法中的哪一步:下游任意视觉数据集零样本推理阶段。

  • 方法优势:
    1. 无限的零样本开放词汇泛化:彻底摆脱固定分类头,任何能用自然语言描述的视觉概念均可实时检测;
    2. 极其卓越的自然分布鲁棒性:由于学习的是广泛的世界常识而非特定数据集过拟合特征,在对抗样本与自然分布漂移下性能衰减极低;
    3. 架构与算力扩展性极佳:性能随着模型容量(ViT-L)与预训练算力增长呈现平滑的乘幂律(Scaling Law)。
  • 方法局限:
    1. 平坦欧氏空间难以建模层级蕴含(Entailment):余弦相似度是对称度量,在几何上无法表达“狗 (Dog) ⊂\subset 食肉动物 (Carnivore) ⊂\subset 哺乳动物 (Mammal)”这种偏序树状包含关系;
    2. 细粒度数理与关系推理薄弱:在计数任务、空间相对方位(如“左边”与“右边”)、抽象逻辑属性上零样本能力较差。

数据来源

  • 数据类型:互联网公开网络弱监督大规模图文多模态数据。
  • 样本来源:
    • WebImageText (WIT):自行从开放网络搜集抓取并清洗的 4 亿图文配对数据集;
    • 评测基准:包含 ImageNet、CIFAR-10/100、MNIST、STL-10、Pascal VOC、Caltech-101、Oxford-Pets、Stanford Cars、Food-101、SUN397 等 30 多个公开标准数据集。
  • 时间范围:论文正式发表于 2021 年 ICML。
  • 样本量/案例数:400,000,000 个图文对,超大训练 Batch Size = 32,768。
  • 数据局限:网络抓取语料存在一定噪声,且英文描述占绝对主导;对专业垂直领域(如医学复杂病理图像)缺乏先验覆盖。

研究结论

  • 主要发现 1:在完全不使用 ImageNet 任何一张训练图片或人工标签的前提下,零样本 CLIP (ResNet-50) 准确率达到了 59.6%,与全监督训练的标准 ResNet-50 完全打平;最强 ViT-L/14@336px 零样本取得 76.2% 的惊人成绩。
  • 原文引用 1:

“For instance, we match the accuracy of the original ResNet-50 on ImageNet zero-shot without needing to use any of the 1.28 million training examples it was trained on.” (Page 1, Abstract)

  • 主要发现 2:对比式代理任务在计算效率上呈现出压倒性优势,其收敛速度是预测性语言模型的 4 倍以上。
  • 原文引用 2:

“Swapping the prediction objective for the contrastive objective of CLIP further improves efficiency another 4x… We observed that contrastive representation learning for images can learn better representations than their equivalent predictive objective.” (Page 3-4, Section 2.3)

  • 主要发现 3:零样本 CLIP 展现出极其强大的鲁棒性,在应对真实世界分布偏移(Distribution Shift)时表现大幅领先同等精度的全监督模型。
  • 原文引用 3:

“We additionally find that zero-shot CLIP models are much more robust than equivalent accuracy supervised ImageNet models which suggests that zero-shot evaluation of task-agnostic models is much more representative of a model’s capability.” (Page 3, Section 1)

我的判断

  • 最有启发的点:确立了“语言作为监督信号”在整个 AI 领域的通用主导地位。图像分类不再是孤立的标签打分,而是图像特征与自然语言概念在几何隐空间的相互检索与对齐。
  • 可借鉴的方法:将离散标签通过上下文模板扩展为自然陈述句(Prompt Engineering),再利用双塔向量内积构建零样本分类器。这种思想在知识图谱实体链接与分类树概念挂载中同样通用。
  • 可继续追问的问题:CLIP 在数学本质上是将多模态特征投影到欧氏单位球面 Sd−1S^{d-1} 上计算余弦角距离。但自然语言的概念具有强烈的上下位树状层级性(如“动物-犬科-哈士奇”)。在平坦超球面上,两个下位概念与同一个上位概念的内积是对称相等的,无法体现“包含与被包含”的非对称方向偏序。如何将 CLIP 的对比学习范式迁移到双曲几何中以建模组合蕴含?
  • 与我的研究关联:本论文是现代视觉-语言基础模型的里程碑基石。在“树模型知识图谱”主题中,CLIP 代表了欧氏图文对齐的最高典范,而紧随其后的下一篇论文 CEL(Pal et al., 2025)正是针对 CLIP 缺乏层级树蕴涵的几何缺陷,在双曲空间中发起的全面革新。
Built with LogoFlowershow