ViT(Vision Transformer)把 Transformer 架构用于图像理解,将图片切块后当作"文字序列"处理,是现代多模态模型的基础模块。
AI Glossary
ViT 的全称是 Vision Transformer(视觉 Transformer),是 2020 年由 Google 团队提出的图像理解架构。它借鉴了自然语言处理中的 Transformer,把图片切成固定大小的"图块"(Patch),每个图块当作一个"词"输入模型,通过自注意力机制理解整张图。
传统 CNN 用卷积核滑动扫描图像,ViT 则让每个图块之间直接建立全局关系——类似"一眼看到整张图的所有局部及其联系"。
ViT 需要大规模数据预训练才能充分发挥能力(小数据集上不如 CNN),计算量也随图块数量增长。后续的 Swin Transformer 等变体针对这一点做了优化。
ViT 把"图像理解"翻译成 Transformer 熟悉的"序列理解",是当前文生图、多模态模型不可或缺的视觉骨干。