CLIP 是 OpenAI 提出的图文对齐模型:把图片与文字映射到同一向量空间,实现"按文字找图"与"给图配文",是文生图与多模态系统的关键组件。
AI Glossary
CLIP(Contrastive Language-Image Pre-training,对比语言-图像预训练)是 OpenAI 在 2021 年提出的多模态模型:同时理解图片和文字,并把两者映射到同一个向量空间。输入一张图,它能找到最匹配的文字描述;输入一段文字,它能找到最匹配的图片。
原理是"对比学习":训练时把配对的图文拉近、不配对的推远,让模型学会图文之间的语义对应。
CLIP 让你可以用一句话描述来找图——"夕阳下的城市天际线",模型会理解语义而非只匹配关键词,这正是多模态搜索体验跃升的关键。
CLIP 教会模型"看懂图文之间的关系",把图片检索从关键词匹配升级到语义理解,是当下多模态应用的通用"对齐层"。