模型蒸馏是把大模型(教师)学到的能力压缩到更小模型(学生)的技术,让小模型在更低的算力成本下接近大模型的水平。
AI Glossary
模型蒸馏(Knowledge Distillation)是把一个能力更强的大模型(教师模型)的知识,迁移到一个更小、更快的模型(学生模型)上的技术。小模型模仿大模型的输出,在保留大部分能力的同时大幅降低推理成本。
大模型能力强但推理贵、响应慢;小模型便宜快但能力弱。蒸馏试图"既要便宜快、又要能力强":让大模型产出高质量答案,小模型学习模仿,最终得到一个尺寸小、成本低、能力接近大模型的学生模型。这也是很多"小模型接近大模型水平"新闻背后的技术。
模型蒸馏是让 AI 能力"下沉"的关键技术:把大模型的能力压缩进小模型,用更低的成本部署更广。它解释了为什么小模型越来越强,也提醒我们关注模型训练的数据合规。