MLAMLモデルの開発
あるスタートアップが、SageMaker リアルタイムエンドポイントで大規模言語モデルを推論しています。レイテンシーは多少犠牲にしてよいので、精度の低下を最小限に抑えつつモデルのメモリフットプリントと推論コストを大幅に削減したいと考えています。元の大規模モデルの知識を保ったまま小型モデルを学習させる手法として最も適切なものはどれですか。
A知識蒸留(Knowledge Distillation)で大規模な教師モデルの出力を用いて小型の生徒モデルを学習させる
✓ 正解
教師モデルの出力で小型の生徒モデルを学習させることで、知識を保持しつつパラメータ数・メモリ・推論コストを削減できるため、精度低下を抑えた小型化という要件に合致する。
Bデータ拡張(Data Augmentation)で訓練データを増やしてモデルを再学習する
データ拡張は訓練データの量や多様性を増やして汎化性能を高める手法であり、モデルのサイズや推論コストの削減には直接寄与しないため要件を満たさない。
Cアーリーストッピングを適用してトレーニングを早期に打ち切る
アーリーストッピングは過学習防止のために学習を早期終了する手法で、学習済みモデルのメモリフットプリントや推論コストを縮小する効果はないため不適切。
Dハイパーパラメータ最適化(HPO)で学習率を調整する
HPOは学習率などの設定を探索して精度を高める手法であり、モデルの圧縮・小型化そのものを行うわけではないため、コストとメモリ削減の要件には直接対応しない。
解説
大規模モデルの知識を保ったまま小型化するには知識蒸留(Knowledge Distillation)が適切。
大きな教師(teacher)モデルの出力(ソフトラベル)を用いて小型の生徒(student)モデルを学習させることで、精度低下を抑えつつパラメータ数・メモリ・推論コストを大幅に削減できる。
量子化やプルーニングと並ぶモデル圧縮の代表的手法である。
選択肢Bのデータ拡張は訓練データの多様性を増やす手法で、モデルサイズの削減には寄与しない。
選択肢Cのアーリーストッピングは過学習を防ぐ学習打ち切り手法で、モデルのメモリフットプリントは縮小しない。
選択肢Dのハイパーパラメータ最適化は精度向上のための探索手法で、モデルの小型化・圧縮を直接行うものではない。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →