梯度下降是训练机器学习模型的核心优化算法:通过计算损失函数对参数的梯度,沿着梯度反方向反复调整参数,让模型的预测误差逐步减小,是深度学习训练的基础机制。
AI Glossary
梯度下降(Gradient Descent)是机器学习中最核心的优化算法:训练模型的本质是"调整参数让预测误差变小",梯度下降负责找到调整方向——它计算损失函数(衡量预测与真实差距的函数)对每个参数的"梯度"(误差随参数变化的斜率),然后沿着让误差下降最快的方向(梯度的反方向)迈一小步更新参数,反复迭代,直到误差收敛到可接受的范围。深度学习模型的训练几乎全部依赖这一机制。
一次典型的梯度下降更新包含三步:
按每次更新用多少数据,梯度下降有三种变体:批量梯度下降(用全部数据,稳但慢)、随机梯度下降 SGD(每次用一个样本,快但震荡)、小批量梯度下降(每次用一小批,兼顾速度与稳定,是最常用形态)。学习率(每次迈步大小)是最关键的超参数:太大收敛不稳甚至发散,太小收敛极慢,实践中常用 Adam 等自适应优化器自动调节步长。
大语言模型的训练同样基于梯度下降(及其加速版本):预训练阶段用海量文本按梯度更新万亿参数,微调阶段用指令数据继续梯度下降。可以说,梯度下降 + 反向传播是支撑整个深度学习时代的两大基础算法——理解它们,就理解了"AI 是怎么学会的"。