过拟合是机器学习中模型"背题不学会"的现象:模型在训练数据上表现很好,但对新数据泛化能力差,是训练中最常见的问题之一,需用正则化、早停、数据增强等方法防治。
AI Glossary
过拟合(Overfitting)是机器学习中最常见的问题之一:模型在训练数据上表现非常好(甚至"背下"了训练样本),但在新数据(测试数据/真实场景)上表现明显变差——就像学生"背题不学会":把练习册答案背得滚瓜烂熟,换一套新题就不会了。过拟合的本质是模型把训练数据里的噪声和偶然规律也当成了通用规律去记忆。
过拟合通常在以下情况发生:模型容量过大(参数太多,"记性好")、训练数据不足(样本太少没学够规律)、训练时间过长(反复学同一批数据)、数据噪声大。判断信号很直接:训练集指标远超验证集指标——训练 99 分、验证 80 分,就是典型过拟合。
常用手段包括:
与过拟合相对的是欠拟合(模型太简单,训练集都没学好)。实践中要"欠拟合与过拟合之间取平衡"。大模型时代过拟合同样存在——参数巨大的模型在数据不足的微调场景尤其容易"背题";对齐训练、RLHF、数据多样化都是缓解手段。理解过拟合,是评估任何 AI 模型可靠性的第一课。