MLA機械学習のためのデータ準備
データエンジニアリングチームが、Amazon S3に蓄積された10TBのクリックストリームデータを週次バッチで処理し、MLモデルの特徴量を生成しています。処理にはカスタムPySparkコードによる複雑なJOINとウィンドウ集計が必要です。週次という実行頻度を考慮して、最もコスト効率の高い構成はどれですか?
AAmazon EMRのトランジェントクラスターをスポットインスタンスで構成し、週次バッチをEMR Stepとして実行する
✓ 正解
週次バッチ処理にはトランジェントEMRクラスター+スポットインスタンスが最もコスト効率的です。ジョブ完了後にクラスターを自動終了するため待機中の課金が発生しません。
BAmazon EMRクラスターをリザーブドインスタンスで常時起動したままにし、週次でSparkジョブをSubmitする
常時稼働のリザーブドクラスターは週次ジョブには過剰投資です。
CAWS Glue ETLジョブ(G.2Xワーカー)でカスタムPySparkスクリプトをWeeklyスケジュールで実行する
AWS Glue ETLはマネージドSparkをサポートしますが、10TBスケールの複雑なカスタムPySparkコードではEMRのほうが設定の柔軟性・パフォーマンスチューニング性が高いです。
DSageMaker Processing JobにカスタムSparkコンテナを使用し、10TBの週次バッチ処理を実行する
SageMaker ProcessingはMLパイプライン統合向きで、大規模Sparkワークロードの主用途ではありません。
解説
選択肢AのトランジェントEMRクラスター(ジョブ完了後に自動終了する一時的なクラスター)+スポットインスタンスが最もコスト効率的です。使用時のみ課金され、スポット料金によりオンデマンド比で最大90%のコスト削減が可能です。
選択肢Bの常時稼働のリザーブドクラスターは週次ジョブには過剰投資で、週168時間中わずかな稼働時間に対して全時間分の費用が発生します。
選択肢CのAWS Glue ETLはマネージドSparkをサポートしますが、10TBスケールの複雑なカスタムPySparkコードではEMRのほうが設定の柔軟性・パフォーマンスチューニング性が高いです。
選択肢DのSageMaker ProcessingはMLパイプライン統合向きで、大規模Sparkワークロードの主用途ではありません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →