蒸留・量子化とは
蒸留(Distillation)は、大きなモデルの出力を教師にして小さなモデルを学習させ、性能をなるべく保ったまま軽くする手法です。
量子化(Quantization)は、重みを表す数値の精度を落としてモデルを小さくし、必要なメモリと計算量を減らす手法です。どちらも応答速度とコストを下げる目的で使われ、精度との兼ね合いを見て選びます。
大きなモデルを小さく軽くする手法。蒸留は振る舞いを写し取り、量子化は数値の精度を落とす。
蒸留(Distillation)は、大きなモデルの出力を教師にして小さなモデルを学習させ、性能をなるべく保ったまま軽くする手法です。
量子化(Quantization)は、重みを表す数値の精度を落としてモデルを小さくし、必要なメモリと計算量を減らす手法です。どちらも応答速度とコストを下げる目的で使われ、精度との兼ね合いを見て選びます。