無限ノック › DEA 練習問題一覧 › 問題
DEAデータオペレーションとサポート

ある企業はApache Sparkを使用して大規模なデータ処理ジョブを実行しています。これらのジョブは不定期に発生し、処理するデータ量も数GBから数TBまで変動します。インフラストラクチャのプロビジョニングやクラスターのスケーリングルールを手動で管理することなく、必要なコンピューティングリソースが自動的に割り当てられ、アイドル時のコストが発生しないサーバーレスアーキテクチャを採用したいと考えています。最適な選択肢はどれですか。

A
Amazon EMR on EC2クラスターを起動し、スポットインスタンスと自動スケーリングルールを使用してコストを最適化する
Amazon EMR on EC2でのスポットインスタンスと自動スケーリングの活用はコスト効率が良いですが、クラスターのプロビジョニングやスケーリングルールの管理といったインフラ管理のオーバーヘッドが残ってしまいます。
B
Amazon EMR Serverlessアプリケーションを作成し、ジョブ送信時にリソースが自動的にスケールするように構成する
✓ 正解
Amazon EMR Serverlessを使用すると、クラスターのインフラ管理が完全に不要になり、ジョブの規模に応じてリソースが自動的に割り当てられ、アイドル時にはコストが発生しないため要件に最適です。
C
AWS Fargateをコンピューティングエンジンとして使用し、永続的なAmazon EMR on EKSクラスターを構築する
Amazon EMR on EKSとAWS Fargateの組み合わせは強力ですが、基盤となるAmazon EKSクラスターの設定や管理が必要であり、インフラストラクチャの管理を完全になくしたいという要件には合致しません。
D
AWS GlueからSparkスクリプトを呼び出し、事前にウォームプールされた固定容量のデータ処理ユニット (DPU) を割り当てる
AWS GlueはサーバーレスのETLサービスですが、不定期に発生する大規模なSparkジョブの実行に対して、事前プールによる固定容量アプローチを取ると、スケーリングの柔軟性が損なわれコスト効率が悪化する可能性があります。

解説

Amazon EMR Serverlessは、クラスターやサーバーをプロビジョニング、構成、管理することなく、Apache SparkやHiveなどのビッグデータフレームワークを実行できるサーバーレスオプションです。ジョブが送信されると、処理するデータとワークロードに応じて必要なコンピューティングおよびメモリリソースが自動的にプロビジョニングおよびスケーリングされ、処理が完了するとリソースが解放されるためアイドル時のコストが発生しません。EMR on EC2はインフラ管理やスケーリングポリシーの設定が必要です。EMR on EKSはKubernetesクラスターの運用が必要です。Glueはサーバーレスですが、固定容量の事前割り当てではなく、完全に自動化されたスケーリングとフレームワークの柔軟性においてはEMR Serverlessがこの要件に最適です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る