MLAMLモデルの開発
あるMLチームがSageMakerでニューラルネットワークモデルの開発フェーズにあります。1日に15〜20回、各20〜30分程度の短いトレーニングジョブを繰り返し実行しており、特徴量やハイパーパラメータを少しずつ変えながらモデルを改善しています。現在、各ジョブ開始時にml.p3.2xlargeインスタンスのプロビジョニング(クラウドリソースの割り当て・起動処理)に4〜6分かかっており、この待機時間が1日あたり合計1〜2時間の無駄となっています。コストを過度に増加させずにプロビジョニング待ち時間を最小化する最も適切な方法はどれですか?
ASageMaker Managed Warm Poolsをトレーニングジョブ設定で有効化し、ジョブ完了後も指定した時間インスタンスをウォーム状態で保持して次のジョブに再利用する
✓ 正解
SageMaker Managed Warm PoolsはKeepAlivePeriodInSeconds設定により、トレーニングジョブ完了後も最大3600秒インスタンスをウォーム状態で保持する機能です。次のジョブが同じインスタンスを再利用することでプロビジョニング時間を数分から数秒に短縮でき、反復実験の多い開発フェーズで最大の効果を発揮します。
BSageMaker Managed Spot Trainingを有効化してスポットインスタンスを使用し、コスト削減によって節約した分をより多くのジョブ実行に充てる
Managed Spot Trainingはコストを最大70%削減できるが、インスタンス起動プロセス自体は短縮されず、スポットインスタンスの中断リスクによりジョブが途中停止する可能性もあるためプロビジョニング待機時間の削減にはなりません。
CSageMaker Studioのノートブックインスタンスをml.p3.2xlargeで常時起動したままにし、トレーニングコードをノートブック上で直接実行する
ノートブックインスタンスをML.p3.2xlargeで常時起動はアイドル中も継続課金され、1日中起動したままにするとコストが大幅に増加し要件に反します。
DSageMaker Local Modeを使用してローカル環境でトレーニングジョブを実行し、クラウドへのプロビジョニング時間をゼロにする
Local Modeはローカルマシンのリソース制限内でのみ動作するため、ml.p3.2xlargeと同等のGPUを使った実験ができず、クラウド環境との結果乖離が生じる恐れがあります。
解説
SageMaker Managed Warm PoolsはKeepAlivePeriodInSeconds設定により、トレーニングジョブ完了後も最大3600秒インスタンスをウォーム状態で保持する機能です。次のジョブが同じインスタンスを再利用することでプロビジョニング時間を数分から数秒に短縮でき、反復実験の多い開発フェーズで最大の効果を発揮します。
選択肢BのManaged Spot Trainingはコストを最大70%削減できるが、インスタンス起動プロセス自体は短縮されず、スポットインスタンスの中断リスクによりジョブが途中停止する可能性もあるためプロビジョニング待機時間の削減にはなりません。
選択肢CのノートブックインスタンスをML.p3.2xlargeで常時起動はアイドル中も継続課金され、1日中起動したままにするとコストが大幅に増加し要件に反します。
選択肢DのLocal Modeはローカルマシンのリソース制限内でのみ動作するため、ml.p3.2xlargeと同等のGPUを使った実験ができず、クラウド環境との結果乖離が生じる恐れがあります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →