智谱编程能力最强的开源模型登场,DeepSeek重新定义性价比,WRC2026即将开幕!
2026/08/17

模型蒸馏(Model Distillation)是一种将大型复杂模型(通常称为“教师模型”)的知识迁移到小型轻量模型(称为“学生模型”)的技术。该方法在保持较高性能的同时,显著降低模型的计算开销和存储需求,广泛应用于边缘设备部署、实时推理等场景。
模型蒸馏的核心思想是让学生模型不仅学习真实标签,还学习教师模型输出的“软目标”(soft targets)。这些软目标包含了类别之间的相对关系信息,例如某个样本虽然被正确分类为“猫”,但教师模型也可能给出较高的“狗”或“狐狸”概率,这种细粒度知识有助于学生模型更好地泛化。通常通过温度参数(temperature)调整 softmax 输出的平滑程度,使知识传递更有效。
模型蒸馏的一般步骤如下:
随着研究深入,模型蒸馏衍生出多种变体,包括但不限于:
这些方法进一步拓展了蒸馏技术的适用边界,使其成为模型高效化的重要工具之一。

联
系
我
们