データエンジニアリングチームは S3 に蓄積された 8 TB のログデータに対して Apache Spark による ML 特徴量抽出処理を毎夜実行する必要があります。 ジョブの実行時間は約3時間です。コスト最小化が最優先事項であり、スポットインスタンス(Spot Instance)中断による稼働への影響は許容できますが、ジョブは自動的に再試行されることが必要です。 最もコスト効率が高い構成はどれですか?
EMR のタスクノードは HDFS データを保持せず計算処理のみを担当するため、スポットインスタンスが中断されてもデータ損失リスクがありません。プライマリノードとコアノードは On-Demand でクラスター安定性を確保しつつ、タスクノードをスポットにすることで大幅なコスト削減が可能です。Spark チェックポイントを S3 に保存することで中断からの自動再開も実現できます。 選択肢AのOn-Demand インスタンスのみの構成は、コスト最適化の観点で劣ります。 選択肢CのSageMaker Processing は、8 TB 規模の大規模 Spark 処理には非効率です。 選択肢DのAWS Glue は、サーバーレスで手軽ですが、DPU(データ処理ユニット)単価課金は長時間・大規模処理でコストが高くなりやすく、EMR スポット活用と比べてコスト効率が劣ります。