AIF生成AIの基礎
エッジデバイス(スマートフォン等)への展開を目指し、大規模言語モデルをより少ないメモリで動作させる必要があります。モデルの重みをFP32(32ビット浮動小数点)からINT8(8ビット整数)に変換することで、メモリ使用量と推論コストを削減する最適化手法はどれですか?
A知識蒸留(Knowledge Distillation)— 大モデルの知識を小モデルに転移
知識蒸留は大モデルを教師として小モデルを訓練する技術で、メモリ使用量削減という要件に直接的に対応していません。
Bモデル量子化(Model Quantization)— 重みのビット精度を下げてメモリと計算コストを削減
✓ 正解
モデル量子化はFP32からINT8への変換により、メモリ使用量を最大75%削減し推論を高速化します。精度はわずかに低下しますが多くのユースケースで許容範囲内です。
Cプルーニング(Pruning)— 重要度の低い重みやニューロンを削除
プルーニングは不要なパラメータを削除する技術で、「最もメモリ効率が高い」という要件に対してはモデル量子化がより直接的に対応します。
DLoRA(Low-Rank Adaptation)— 低ランク行列を追加して効率的にファインチューニング
LoRAはファインチューニングコスト削減技術であり、推論時のメモリ削減には直結しません。
解説
モデル量子化はFP32からINT8等への変換により、メモリ使用量を最大75%削減し推論を高速化する技術です。精度はわずかに低下しますが多くのユースケースで許容範囲内です。
選択肢Aの 知識蒸留は大モデルを教師として小モデルを訓練する技術です。
選択肢Cの プルーニングは不要なパラメータを削除する技術です。
選択肢Dの LoRA はファインチューニングコスト削減技術です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →