MLAMLモデルの開発

データサイエンティストが SageMaker で大規模 Transformer モデル(fp16 でおよそ 20GB)をトレーニングしようとしている。利用予定のインスタンスは ml.p3.8xlarge(4×V100、各 16GB VRAM)で、単一 GPU にモデル全体が収まらない状況。追加インスタンスを増やさずにトレーニングを成功させるには、どのアプローチが適切か。

A
SageMaker 分散データ並列ライブラリ(SMDDP)を有効化し、ミニバッチを複数 GPU に分割して処理する
SMDDP はデータを分割して並列処理するが、各 GPU にモデル全体が収まることが前提であり、VRAM 不足の根本解決にはならない。
B
SageMaker Managed Spot Training を有効化し、複数のスポットインスタンスを利用してコストを削減する
Managed Spot Training はコスト削減策であり、GPU ごとの VRAM 容量不足という物理制約を解決する機能ではない。
C
Gradient Checkpointing を有効化して中間アクティベーションを再計算し、単一 GPU のメモリ消費を抑える
Gradient Checkpointing は中間アクティベーションのメモリを削減できるが、20GB のモデル重み自体が 16GB GPU に収まらない問題は解決できない。
D
SageMaker モデル並列ライブラリ(SMP)を使用し、モデルレイヤーを複数 GPU に分割してトレーニングする
✓ 正解
SMP はモデルレイヤーを複数 GPU に分割することで、単一 GPU に収まらない大規模モデルを複数デバイスで分散保持できる。

解説

モデルが単一 GPU に収まらない場合、SMP のモデル並列がレイヤーを複数 GPU に分割配置することで VRAM 制約を解消できる唯一の方法。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る