無限ノック › MLA 練習問題一覧 › 問題
MLAMLモデルの開発

あるチームが70Bパラメーターの大規模言語モデル(LLM)をSageMakerでファインチューニングしようとしています。最大サイズのGPUインスタンス(ml.p4d.24xlarge:A100×8基)1台ではモデル全体をGPUメモリに収めることができません。最小限の運用負荷でこの問題を解決するための最も適切なアプローチはどれですか?

A
SageMaker Data Parallelライブラリを使用し、AllReduceアルゴリズムで複数インスタンスにデータを分散させる
SageMaker Data Parallelはデータ並列の実装でありモデルが1GPUに収まらない場合は使用不可です。
B
SageMaker Model Parallelライブラリを使用し、テンソル並列またはパイプライン並列でモデルを複数GPU・インスタンスに分割する
✓ 正解
データ並列(Data Parallel)は各ワーカーがモデル全体のコピーを保持するため、モデルが1GPUに収まらない場合には使用できません。SageMaker Processing Jobsはデータ前処理や特徴量エンジニアリングなどのバッチ処理向けであり、分散モデルトレーニングには設計されていません。モデルが単一デバイスのメモリ容量を超える場合はモデル並列(Model Parallelism)が必要です。SageMaker Model Parallelライブラリは、テンソル並列やパイプライン並列をマネージドな形で提供し、LLMのファインチューニングに広く活用されます。
C
Horovod(分散深層学習フレームワーク)を使ったデータ並列トレーニングを設定し、グラジェントを全インスタンスで集約する
Horovodはデータ並列フレームワークであり、大規模モデルを分割する機能がありません。
D
SageMaker Processing Jobを複数起動し、モデルの各レイヤーを別々に処理して後で結合する
SageMaker Processing Jobsはデータ前処理向けであり、分散モデルトレーニングには設計されていません。

解説

モデルが単一デバイスのメモリ容量を超える場合は、データ並列ではなくモデル並列(Model Parallelism)が必要です。 選択肢AのSageMaker Data Parallelは、データ並列の実装であり各ワーカーがモデル全体のコピーを保持します。モデルが1GPUに収まらない場合には使用できず、メモリ不足の問題を解消できません。 選択肢BのSageMaker Model Parallelライブラリは、テンソル並列やパイプライン並列をマネージドな形で提供し、単一GPUに収まらない大規模モデルを複数GPU・インスタンスに分割してファインチューニングできます。LLMのトレーニングに最も適したアプローチです。 選択肢CのHorovodは、データ並列の分散トレーニングフレームワークであり各ノードがモデル全体のコピーを保持します。大規模モデルを複数デバイスに分割するモデル並列機能はありません。 選択肢DのSageMaker Processing Jobsは、データ前処理や特徴量エンジニアリングなどのバッチ処理向けサービスであり、分散モデルトレーニングには設計されていません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る