反向传播(Backpropagation)是神经网络训练的核心算法:从输出层向输入层逐层反向计算损失对各层参数的梯度,让梯度下降能高效更新深层网络的每一层参数。
AI Glossary
反向传播(Backpropagation,简称 BP)是训练神经网络的奠基性算法:神经网络由很多层组成,要更新每一层的参数就需要知道"这一层参数该往哪调"——也就是损失对每层参数的梯度。反向传播做的正是这件事:从输出层的误差开始,利用微积分里的链式法则,把误差逐层向输入方向"传"回去,同时算出每一层参数的梯度。1986 年鲁梅尔哈特等人使其普及,是深度学习训练的地基。
一个深层网络可能有数百层、数十亿参数。如果逐层独立估计梯度,计算量不可接受;反向传播的高明之处是复用:输出层的误差每向后传一层,就顺路算出该层的梯度,一趟"从后往前"的传播就能得到所有层的梯度——计算效率与层数成正比,而非指数。没有它,深层网络根本训练不起来。
反向传播负责"算出梯度",梯度下降负责"更新参数":每一次训练迭代 = 前向传播(预测、算损失)→ 反向传播(逐层算梯度)→ 梯度下降(更新所有层参数)。这个循环在现代框架(PyTorch、TensorFlow)里是自动完成的(自动微分),开发者只需定义网络结构与损失函数。
大语言模型的预训练与微调依然每步都在执行反向传播(虽然大规模训练会叠加分布式与混合精度等工程优化)。理解反向传播 = 理解"AI 的参数是怎么被训练出来的",它和梯度下降一起,是所有深度学习技术共用的底层引擎。