大手EC企業のMLエンジニアが、パラメータ数が単一GPUのVRAM容量を大幅に超える大規模トランスフォーマーモデルのファインチューニングをSageMakerで行おうとしています。ml.p4d.24xlarge(GPU 8台)で試みましたが、モデル全体が単一GPUに収まらずOut of Memoryエラーが発生しています。複数インスタンスを活用してこのメモリ問題を根本解決するための最も適切なアプローチはどれですか。
A
SageMaker Data Parallelism Library でデータを複数GPUに分割し AllReduce で勾配を同期してトレーニングスループットを向上させる
SageMaker Data Parallelism Library(SMDDP)はトレーニングデータを複数GPUに分割し AllReduce 通信で勾配を同期する「データ並列化」手法。各GPUはモデル全体のコピーを保持することが前提のため、モデルが単一GPUのVRAMに収まらないOOMの根本解決には適用できない。
B
SageMaker Model Parallelism Library でモデルのレイヤーをシャーディングして複数GPUのメモリに分散させる
✓ 正解
SageMaker Model Parallelism Library(SMP)はモデルのレイヤーを複数GPUに分割する「モデル並列化」手法。各GPUがモデルの一部のみを保持するため、単一GPUのVRAMを超える大規模モデルでもOOMなしで訓練が可能になる。大規模LLMのファインチューニングに最適な正しい選択。