模型蒸馏(Model Distillation)是一种模型压缩技术:用大模型(教师)的输出作为监督信号,训练一个更小的模型(学生)模仿其行为,让小模型以更低算力成本接近大模型的能力,典型应用如让开源小模型学习闭源大模型的回复风格。
AI Glossary
模型蒸馏(Model Distillation,也称知识蒸馏)是一种模型压缩与迁移技术:用一个能力更强的大模型(称为「教师模型」)的输出作为训练信号,去训练一个更小、更快的模型(称为「学生模型」),让后者模仿前者的行为,从而以远低于大模型的算力成本接近其能力。
它最早由 Hinton 等人于 2015 年系统提出。核心直觉是:大模型的输出不只是「对错标签」,还包含丰富的「软信息」——比如一个分类模型给出的概率分布、一个对话模型对不同候选回答的偏好,这些软信息比硬标签更能教会小模型「为什么会这样答」。
蒸馏的核心是「软标签学习」。传统训练用硬标签(0 或 1),蒸馏则让教师模型输出概率分布(软标签),学生模型同时学习硬标签与软标签:软标签里包含了类别之间的相似关系(比如「猫」和「狗」比「猫」和「汽车」更接近),帮助学生模型学到更细腻的决策边界。
在大语言模型场景,蒸馏演化为两种主要方式:
一是输出模仿:用大模型的问答数据(问题+大模型回答)直接微调小模型,让小模型学会大模型的表达风格与推理路径。
二是偏好迁移(RLHF 蒸馏):让大模型充当奖励信号或偏好标注者,用其偏好数据对齐小模型,常见于开源模型「对齐」闭源模型行为的做法。
蒸馏在开源大模型生态中扮演关键角色:很多开源小模型(如各类 7B/8B 模型)就是通过蒸馏大模型的输出来获得「聪明感」,例如用闭源旗舰模型的回复数据训练开源基座,让小模型在对话质量上大幅接近教师。
蒸馏的价值在于「能力平权」:把动辄千亿参数的旗舰模型能力,压缩到可跑在消费级显卡甚至手机上的小模型,同时保持大部分能力,让个人开发者与中小企业也能负担。
部署压缩:把大模型蒸馏成小模型部署到端侧(手机、嵌入式设备),降低延迟与成本。
能力迁移:用闭源旗舰模型的输出提升开源小模型的对话质量与指令遵循能力。
特定任务优化:把通用大模型蒸馏成特定领域(客服、法律、医疗)的高效专用模型。
一是「学生不可能超过老师」:蒸馏上限受教师能力约束,教师本身不会的内容,学生也学不会。
二是数据成本:高质量的教师输出数据(尤其偏好数据)获取成本不低。
三是能力损耗:蒸馏后的小模型在复杂推理、长上下文等维度通常仍有明显差距,需要权衡规模与能力。
模型蒸馏是「把大模型的能力打包进小模型」的关键技术,它让高性能 AI 从云端旗舰下沉到个人设备与低成本场景,也解释了为什么今天小模型能越来越「聪明」。它与你可能听过的 RAG、微调共同构成模型应用的不同环节:蒸馏决定模型本身的能力上限,RAG 决定模型调用知识的方式,微调决定模型的风格与领域适配。