卷积神经网络(CNN)是擅长图像与视觉数据的神经网络结构:通过卷积核提取局部特征并层层组合,是图像识别、目标检测等计算机视觉任务的核心架构。
AI Glossary
卷积神经网络(Convolutional Neural Network,CNN)是专门处理图像与视觉数据的神经网络结构:普通网络把图像展开成一行像素会丢失空间关系,CNN 则用"卷积核"在图像上滑动,局部提取特征(边缘、纹理),再层层组合成高级语义(眼睛、车轮、人脸),天然契合图像的二维结构。它是计算机视觉的核心架构——从手机相册人脸识别到自动驾驶目标检测,背后都是 CNN 及其变体。
CNN 的两个关键操作:
CNN 的里程碑:LeNet(手写数字识别开山之作)、AlexNet(深度学习爆发起点)、ResNet(残差连接解决深层网络退化,让百层网络可训练)。2010 年代 CNN 统治视觉领域;2020 年起 Transformer 架构(ViT)在大规模数据上超越 CNN,成为视觉新主流——但 CNN 的高效与局部归纳偏好仍在移动端、轻量模型与工业场景中广泛使用。
图像分类、目标检测(YOLO 系列)、人脸识别、医学影像分析、工业质检、自动驾驶视觉,以及图像生成模型的判别部分(GAN 的判别器)。CNN 是"AI 看懂世界"最重要的架构之一,理解它与卷积机制,是进入计算机视觉领域的第一步。