無限ノック › DEA 練習問題一覧 › 問題
DEAデータの取り込みと変換

あるスタートアップは、1日に数回、不定期にデータ変換のSparkジョブを実行しています。各ジョブの実行時間は数分から30分程度でばらつきがあり、ジョブが走っていない時間が大半です。常時起動のEMRクラスターは待機コストが無駄になるため避けたいと考えています。Sparkワークロードに対して最もコスト効率が高く運用負荷の低い実行基盤はどれですか。

A
Amazon EC2スポットインスタンスで自前のSparkクラスターを構築し、ジョブ時のみ起動・停止する
EC2スポットインスタンスは単価は安いものの、Sparkクラスターの構築・起動停止・スポット中断への対応をすべて自前で管理する必要があり、運用負荷が低いという条件を満たしません。
B
Amazon EMR Serverlessを使い、ジョブ投入時に自動でリソースをプロビジョニングして実行する
✓ 正解
EMR Serverlessはクラスター管理なしでジョブ投入時にリソースを自動プロビジョニングし、完了後に自動スケールダウンして使用分のみ課金されるため、不定期・短時間のSparkワークロードで待機コストが発生せず、最もコスト効率が高く運用負荷も低くなります。
C
Amazon EMR on EC2で常時起動クラスターを最小ノード構成にし、Auto Scalingで拡張する
EMR on EC2の常時起動クラスターは最小ノード構成でも待機中ノードへの課金が継続するため、ジョブが走らない大半の時間のコストが無駄になり、不定期ワークロードには非効率です。
D
AWS Glue ETLジョブのワーカー数を最大に設定し、ジョブ実行のたびに手動で起動する
Glue ETLもサーバーレスですが、ワーカー数を最大固定するとジョブ規模に関わらず過剰なリソースに課金されコスト効率に反し、既存Sparkワークロードとの親和性でもEMR Serverlessが優れます。

解説

Amazon EMR Serverlessは、クラスターのプロビジョニングや管理なしにSpark/Hiveジョブを実行できるサーバーレス実行基盤です。 ジョブ投入時に必要なリソースを自動でプロビジョニングし、ジョブ完了後は自動的にスケールダウンします。 実際にジョブが使用したリソースに対してのみ課金されるため、不定期・短時間のワークロードで待機コストが発生せず、最もコスト効率が高く運用負荷も低くなります。 選択肢Aの EC2スポットインスタンス は安価だが、クラスターの構築・起動停止・中断対応を自前で管理する必要があり運用負荷が高い。 選択肢Cの EMR on EC2 常時起動 は最小構成でも待機中のノードに課金が続き、ジョブが走らない大半の時間が無駄になる。 選択肢Dの AWS Glue ETLジョブ もサーバーレスだが、既存のSparkワークロードという文脈ではEMR Serverlessの方が既存Spark資産との親和性が高く、ワーカー数最大固定はコスト効率に反する。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る