大規模な教師モデル(Teacher Model)の「ソフトラベル」(各クラスへの確率分布)を使って、より小さく効率的な生徒モデル(Student Model)を訓練することで、軽量かつ高性能なモデルを作成する技術はどれですか?
知識蒸留は大規模な教師モデルが持つ知識を小さな生徒モデルに転移させる技術です。正解のみのハードラベルでなく、クラス間の類似性などを含むソフトラベル(確率分布)を使うことで豊かな情報を伝達します。 選択肢Aのファインチューニングは、特定タスク向け追加学習です。 選択肢Bの転移学習は、事前学習済み重みの再利用です。 選択肢Dの連合学習は、データを分散させたままのプライバシー保護技術です。