MLAMLモデルの開発
スタートアップ企業のMLエンジニアが大規模言語モデルのファインチューニングジョブをml.p3.16xlarge(オンデマンド単価$24/時間)で実施します。推定実行時間は40時間(総コスト$960相当)です。トレーニングの中間状態をS3に定期的に保存する実装済みのため、中断後の再開が可能です。一回限りの学習ジョブで最大限コストを削減するには、どの選択肢が最も効果的ですか?
ASageMaker Managed Spot Trainingを有効にしチェックポイントをS3に保存、MaxWaitTimeInSecondsを適切に設定してスポットで学習する
✓ 正解
Managed Spot Trainingはスポットインスタンスを使用してオンデマンド比最大90%のコスト削減が可能です。S3へのチェックポインティングと組み合わせることで中断リスクを実質排除でき、一回限りのジョブに最適な選択肢です。
Bml.p3.16xlarge のリザーブドインスタンス(1年コミット)を購入し、オンデマンドより割安な料金でトレーニングする
リザーブドインスタンスは最大72%の割引を提供しますが、1年または3年の長期コミットメントが必要です。一回限りのトレーニングジョブでは契約期間が無駄になり、コスト効果が得られません。
CSageMaker Savings Plans(1年コミットメント)を適用してSageMaker利用コスト全体を削減してトレーニングする
SageMaker Savings Plansも1年または3年の長期コミットメントが前提です。単発ジョブではコミットメント期間を有効活用できず、Spot Trainingほどの割引率(最大90%)は期待できません。
Dml.g4dn.12xlarge(低単価GPU)に切り替え、複数インスタンスでの分散トレーニングにより総コストを抑制する
ml.g4dn.12xlarge(T4 GPU)はml.p3.16xlarge(V100 GPU)より深層学習の演算性能が劣るため、学習時間が大幅に増加します。分散設定コストも加わり、合計コストが増加するリスクがあります。
解説
SageMaker Managed Spot TrainingはEC2スポットインスタンスをSageMakerトレーニングジョブに活用し、オンデマンド比で最大90%のコスト削減が可能です。スポットインスタンスが中断された場合でも、S3に保存したチェックポイントから自動的に再開するため、チェックポイント対応済みのジョブでは実質的なリスクなく大幅なコスト削減が実現します。MaxWaitTimeInSecondsでスポット容量の最大待機時間を設定することで、全体の完了時間を制御できます。
選択肢Bのリザーブドインスタンスは最大72%の割引を提供しますが、1年または3年の長期コミットメントが必要です。一回限りのトレーニングジョブでは契約期間に見合うコスト効果が得られません。
選択肢CのSageMaker Savings Plansも1年または3年の長期コミットメントが前提であり、単発のジョブでは割引効果を十分に享受できず、Managed Spot Trainingほどの削減率(最大90%)には及びません。
選択肢Dのml.g4dn.12xlarge(T4 GPU)はml.p3.16xlarge(V100 GPU)より深層学習性能が低く、総学習時間が大幅に伸びる可能性があります。分散設定のオーバーヘッドも加わり、合計コストがManaged Spot Training利用時を上回るリスクがあります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →