ある企業が数百億パラメータの高性能言語モデルをAPI経由で利用していますが、コストが高騰しています。この企業は、大規模モデルの性能をできるだけ維持しながら、大幅に小型のモデルを社内サーバーにホスティングしたいと考えています。大規模モデルが出力する「ソフトラベル(各トークンの出力確率分布)」を教師信号として活用することで、小型モデルの精度を高める手法として最も適切なものはどれですか?
知識蒸留(Knowledge Distillation):大規模な「教師(Teacher)モデル」の出力確率分布を使って小型の「生徒(Student)モデル」を訓練し、教師の暗黙の知識を移転する。 知識蒸留(Knowledge Distillation)は、大規模「教師モデル」が出力するトークンごとの確率分布(ソフトラベル)を教師信号として、小型「生徒モデル」を訓練します。正解のみのハードラベルより多くの情報を含むソフトラベルを使うことで、生徒モデルは教師が学んだ「暗黙の知識(どのトークンが互いに似ているか等)」を効率的に習得できます。 選択肢A(ファインチューニング)は既存モデルを特定タスクに適応させるものであり、別モデルへの知識移転・サイズ縮小を目的としません。 選択肢C(モデル量子化)は重みの数値精度を下げてメモリを削減しますが、異なるモデル間の知識移転は行わず、既存問題でも扱われた別手法です。 選択肢D(スパースアテンション)はTransformer内部の計算を間引く最適化手法であり、モデル間の知識移転とは無関係です。