無限ノック › MLA 練習問題一覧 › 問題
MLAMLモデルの開発

MLチームが医療画像診断用の大規模ビジョントランスフォーマー(ViT)モデル(パラメータ数600億)をSageMakerでトレーニングしています。使用インスタンスはml.p3.8xlarge(GPU1枚あたり16GB VRAM × 4GPU = 合計64GB)ですが、モデルパラメータだけで100GB以上のメモリが必要なため、単一インスタンスのGPUメモリに収まりません。このメモリ制約を根本的に解決するために最も適切なSageMakerの分散トレーニング戦略はどれですか?

A
SageMaker分散データ並列(SMDDP)を使用し、各ワーカーにモデルの完全なコピーを配置してミニバッチを分割して並列学習する
分散データ並列(SMDDP)は各ワーカーがモデルの完全なコピーを保持する設計です。単一GPUのメモリを超えるモデルは各ワーカーにも配置できないため、600億パラメータのモデルには使用できません。
B
SageMaker Model Parallelism Libraryを使用し、モデルのレイヤーを複数のGPUやインスタンスに分割してメモリ制約を解消する
✓ 正解
SageMaker Model Parallelism Libraryはモデルのレイヤーやテンソルを複数のGPU・インスタンスに分割する技術であり、単一GPUに収まらない超大規模モデルのトレーニングを実現します。パイプライン並列化とテンソル並列化の両方をサポートします。
C
SageMaker Pipe ModeでS3からデータをストリーミングし、GPUのデータ保持量を減らしてメモリ不足を解消する
Pipe ModeはS3からのデータロードを効率化するストリーミング機能です。入力データの読み込み速度は改善されますが、GPUメモリ上に展開されるモデルパラメータのサイズには影響せず、メモリ不足は解消されません。
D
勾配チェックポインティング(Gradient Checkpointing)のみを有効にして単一インスタンスのGPUメモリ使用量を削減して学習する
勾配チェックポインティングは中間活性化値の再計算によりGPUメモリを節約できます。しかしモデルパラメータ(600億パラメータで120GB以上)は依然としてGPUメモリに必要であり、64GBのメモリ制約は解決できません。

解説

SageMaker Model Parallelism Library(SMP)はモデルが単一GPUに収まらない場合に使用する分散学習手法です。モデルの各レイヤーやテンソルを複数のGPU・インスタンスに自動分割し、600億パラメータのような超大規模モデルでもトレーニングを可能にします。パイプライン並列化とテンソル並列化の両方をサポートしており、GPUメモリの物理的な制約を超えられるのが最大の特徴です。 選択肢AのSMDDPは各ワーカーがモデルの完全なコピーを保持するデータ並列手法です。単一GPUに収まらない600億パラメータのモデルには適用できず、そもそも起動できません。 選択肢CのPipe Modeはトレーニングデータのストリーミングロードを最適化する機能であり、GPUメモリ上に保持するモデルパラメータ自体のサイズは一切削減できません。 選択肢Dの勾配チェックポインティングはフォワードパスの中間活性化値を破棄して再計算することでメモリを節約しますが、モデルパラメータ(600億 × 2〜4バイト = 120〜240GB)そのものは削減されず、64GBのGPUメモリでは依然として収まりません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る