数据增强是通过对训练数据做变换(旋转、裁剪、加噪、改写等)产生更多样样本的方法:在不增加真实数据采集成本的前提下提升模型泛化能力、缓解过拟合。
AI Glossary
数据增强(Data Augmentation)是机器学习中的常用技术:对已有的训练数据施加各种变换,产生"看起来不同、本质同类"的新样本——旋转一张猫的图片、裁掉一部分再补回去、给语音加一点噪音、把一句话换个说法。这样在不增加真实数据采集成本的前提下,把训练集从"一小批"变成"一大批",让模型看到更多样的数据,从而学得更稳、泛化更好、更不容易过拟合。
不同数据类型有各自的增强方式:
数据增强有两个作用:一是多样性——让模型对不同拍摄角度、光线、表达方式都鲁棒;二是正则化——抑制模型死记训练样本(背图/背句子),被迫学习更本质的规律。因此增强既是"数据问题"也是"防过拟合问题",与正则化相辅相成。
大模型时代数据增强依然关键:图像生成模型的训练用大量几何/色彩增强;文本大模型用"改写、回译、合成数据"扩增训练语料;多模态数据增强提升跨模态鲁棒性。理解数据增强,就理解了"AI 为什么见得多、不怕变"。
用通俗中文解释 AI 技术术语,帮助你看懂工具页面里的模型、协议和工作流。