データサイエンティストが SageMaker で大規模 Transformer モデル(fp16 でおよそ 20GB)をトレーニングしようとしている。利用予定のインスタンスは ml.p3.8xlarge(4×V100、各 16GB VRAM)で、単一 GPU にモデル全体が収まらない状況。追加インスタンスを増やさずにトレーニングを成功させるには、どのアプローチが適切か。
モデルが単一 GPU に収まらない場合、SMP のモデル並列がレイヤーを複数 GPU に分割配置することで VRAM 制約を解消できる唯一の方法。