一句话说清:知识蒸馏(Knowledge Distillation)说白了,就是训练一个便宜的小模型去模仿一个昂贵的大模型,把后者已经学会的“回答问题的本事”装进前者肚子里,让它也能跑、却小得多。1. 它到底在说什么知识蒸馏(Knowledge Distillation)是一种“以大模型教小模型”的模型压缩方法。它的核心直觉很朴素:与其让小模型从零开始死记硬背标准答案,不如让它去模仿一个已经很厉害的大模型(teacher,教师)是怎么思考、怎么下结论的——这个更小的模型叫 student(学生)。打个比方:一位经验丰富的主厨做菜,不仅给出成品,还会在每一步透露“这步火候差一点就该收手”“旁边那味料差点就喧宾夺主”。徒弟照着这位主厨的整套判断去练,比只看菜谱上的“盐三克、油五毫升”学得快、学得像。蒸馏里,主厨对每个备选答案给出的“倾向程度”,就是比标准答案信息量大得多的训练信号。2. 为什么现在这个词很热2006 年,Bucila 等人提出用大模型去压缩小模型的雏形;但真正成为现代方法,是2015 年Geoffrey Hinton、Oriol Vinyals、Jeff Dean 的论文《Distilling the Knowled