MLA機械学習のためのデータ準備

データエンジニアリングチームが、Amazon S3に蓄積された10TBのクリックストリームデータを週次バッチで処理し、MLモデルの特徴量を生成しています。処理にはカスタムPySparkコードによる複雑なJOINとウィンドウ集計が必要です。週次という実行頻度を考慮して、最もコスト効率の高い構成はどれですか?

A
Amazon EMRのトランジェントクラスターをスポットインスタンスで構成し、週次バッチをEMR Stepとして実行する
✓ 正解
週次バッチ処理にはトランジェントEMRクラスター+スポットインスタンスが最もコスト効率的です。ジョブ完了後にクラスターを自動終了するため待機中の課金が発生しません。
B
Amazon EMRクラスターをリザーブドインスタンスで常時起動したままにし、週次でSparkジョブをSubmitする
常時稼働のリザーブドクラスターは週次ジョブには過剰投資です。
C
AWS Glue ETLジョブ(G.2Xワーカー)でカスタムPySparkスクリプトをWeeklyスケジュールで実行する
AWS Glue ETLはマネージドSparkをサポートしますが、10TBスケールの複雑なカスタムPySparkコードではEMRのほうが設定の柔軟性・パフォーマンスチューニング性が高いです。
D
SageMaker Processing JobにカスタムSparkコンテナを使用し、10TBの週次バッチ処理を実行する
SageMaker ProcessingはMLパイプライン統合向きで、大規模Sparkワークロードの主用途ではありません。

解説

選択肢AのトランジェントEMRクラスター(ジョブ完了後に自動終了する一時的なクラスター)+スポットインスタンスが最もコスト効率的です。使用時のみ課金され、スポット料金によりオンデマンド比で最大90%のコスト削減が可能です。 選択肢Bの常時稼働のリザーブドクラスターは週次ジョブには過剰投資で、週168時間中わずかな稼働時間に対して全時間分の費用が発生します。 選択肢CのAWS Glue ETLはマネージドSparkをサポートしますが、10TBスケールの複雑なカスタムPySparkコードではEMRのほうが設定の柔軟性・パフォーマンスチューニング性が高いです。 選択肢DのSageMaker ProcessingはMLパイプライン統合向きで、大規模Sparkワークロードの主用途ではありません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る