無限ノック › AIF 練習問題一覧 › 問題
AIF生成AIの基礎

ある企業が数百億パラメータの高性能言語モデルをAPI経由で利用していますが、コストが高騰しています。この企業は、大規模モデルの性能をできるだけ維持しながら、大幅に小型のモデルを社内サーバーにホスティングしたいと考えています。大規模モデルが出力する「ソフトラベル(各トークンの出力確率分布)」を教師信号として活用することで、小型モデルの精度を高める手法として最も適切なものはどれですか?

A
ファインチューニング(Fine-tuning):タスク固有のラベル付きデータで小型モデルを再学習し、特定タスクへ適応させる
(ファインチューニング)は既存モデルを特定タスクに適応させるものであり、別モデルへの知識移転・サイズ縮小を目的としません。
B
知識蒸留(Knowledge Distillation):大規模な「教師(Teacher)モデル」の出力確率分布を使って小型の「生徒(Student)モデル」を訓練し、教師の暗黙の知識を移転する
✓ 正解
知識蒸留(Knowledge Distillation):大規模な「教師(Teacher)モデル」の出力確率分布を使って小型の「生徒(Student)モデル」を訓練し、教師の暗黙の知識を移転する。 知識蒸留(Knowledge Distillation)は、大規模「教師モデル」が出力するトークンごとの確率分布(ソフトラベル)を教師信号として、小型「生徒モデル」を訓練します。正解のみのハードラベルより多くの情報を含むソフトラベルを使うことで、生徒モデルは教師が学んだ「暗黙の知識(どのトークンが互いに似ているか等)」を効率的に習得できます。
C
モデル量子化(Quantization):モデルの重みをFP32からINT8等の低精度表現に変換してメモリ使用量を削減する
(モデル量子化)は重みの数値精度を下げてメモリを削減しますが、異なるモデル間の知識移転は行わず、既存問題でも扱われた別手法です。
D
スパースアテンション(Sparse Attention):Transformerのアテンション計算を間引くことで、推論時のメモリと計算量を効率化する
(スパースアテンション)はTransformer内部の計算を間引く最適化手法であり、モデル間の知識移転とは無関係です。

解説

知識蒸留(Knowledge Distillation):大規模な「教師(Teacher)モデル」の出力確率分布を使って小型の「生徒(Student)モデル」を訓練し、教師の暗黙の知識を移転する。 知識蒸留(Knowledge Distillation)は、大規模「教師モデル」が出力するトークンごとの確率分布(ソフトラベル)を教師信号として、小型「生徒モデル」を訓練します。正解のみのハードラベルより多くの情報を含むソフトラベルを使うことで、生徒モデルは教師が学んだ「暗黙の知識(どのトークンが互いに似ているか等)」を効率的に習得できます。 選択肢A(ファインチューニング)は既存モデルを特定タスクに適応させるものであり、別モデルへの知識移転・サイズ縮小を目的としません。 選択肢C(モデル量子化)は重みの数値精度を下げてメモリを削減しますが、異なるモデル間の知識移転は行わず、既存問題でも扱われた別手法です。 選択肢D(スパースアテンション)はTransformer内部の計算を間引く最適化手法であり、モデル間の知識移転とは無関係です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIF の問題一覧に戻る