蒸留・量子化とは

蒸留(Distillation)は、大きなモデルの出力を教師にして小さなモデルを学習させ、性能をなるべく保ったまま軽くする手法です。

量子化(Quantization)は、重みを表す数値の精度を落としてモデルを小さくし、必要なメモリと計算量を減らす手法です。どちらも応答速度とコストを下げる目的で使われ、精度との兼ね合いを見て選びます。