無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

データエンジニアリングチームは S3 に蓄積された 8 TB のログデータに対して Apache Spark による ML 特徴量抽出処理を毎夜実行する必要があります。 ジョブの実行時間は約3時間です。コスト最小化が最優先事項であり、スポットインスタンス(Spot Instance)中断による稼働への影響は許容できますが、ジョブは自動的に再試行されることが必要です。 最もコスト効率が高い構成はどれですか?

A
全ノード(プライマリ・コア・タスク)を On-Demand インスタンスで構成した Amazon EMR クラスターを起動し、Spark ジョブを安定的に実行する
On-Demand インスタンスのみの構成は、コスト最適化の観点で劣ります。
B
プライマリ・コアノードに On-Demand、タスクノード(Task Node)にスポットインスタンスを使用した EMR クラスターを構成し、Spark チェックポイントを S3 に保存する
✓ 正解
EMR のタスクノードは HDFS データを保持せず計算処理のみを担当するため、スポットインスタンスが中断されてもデータ損失リスクがありません。プライマリノードとコアノードは On-Demand でクラスター安定性を確保しつつ、タスクノードをスポットにすることで大幅なコスト削減が可能です。Spark チェックポイントを S3 に保存することで中断からの自動再開も実現できます。
C
SageMaker Processing ジョブで ml.m5.4xlarge インスタンスを複数台使用し、フルマネージドな分散 Spark 環境で特徴量抽出処理を実行する
SageMaker Processing は、8 TB 規模の大規模 Spark 処理には非効率です。
D
AWS Glue ETL ジョブを使用して DPU(データ処理ユニット、Data Processing Unit)のオートスケールを活用し、サーバーレスで Spark 処理を実行する
AWS Glue は、サーバーレスで手軽ですが、DPU(データ処理ユニット)単価課金は長時間・大規模処理でコストが高くなりやすく、EMR スポット活用と比べてコスト効率が劣ります。

解説

EMR のタスクノードは HDFS データを保持せず計算処理のみを担当するため、スポットインスタンスが中断されてもデータ損失リスクがありません。プライマリノードとコアノードは On-Demand でクラスター安定性を確保しつつ、タスクノードをスポットにすることで大幅なコスト削減が可能です。Spark チェックポイントを S3 に保存することで中断からの自動再開も実現できます。 選択肢AのOn-Demand インスタンスのみの構成は、コスト最適化の観点で劣ります。 選択肢CのSageMaker Processing は、8 TB 規模の大規模 Spark 処理には非効率です。 選択肢DのAWS Glue は、サーバーレスで手軽ですが、DPU(データ処理ユニット)単価課金は長時間・大規模処理でコストが高くなりやすく、EMR スポット活用と比べてコスト効率が劣ります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る