DEAデータの取り込みと変換
ある動画ストリーミング会社は、毎日100TBを超えるユーザー視聴ログをAmazon S3に保存しています。このデータに対して、社内独自のPySparkライブラリを使った複雑な集計・機械学習前処理バッチジョブを実行したい。AWS Glueではサポートされていない特定バージョンのSparkとカスタムライブラリが必須であり、バッチ処理コストを大幅に削減したい。最も適切な構成はどれか。
AAWS Glue ETLジョブのカスタムコネクタ機能とアドオンJARを利用して独自ライブラリを追加し、スケジュール実行する
AWS GlueはフルマネージドETLサービスですが、使用できるSparkバージョンと利用可能なライブラリが制限されています。特定バージョンのSparkへのピン留めや非対応のカスタムPySparkライブラリの導入は実質的に困難で、この要件を満たせません。
BAmazon EMRクラスターのタスクノードにEC2スポットインスタンスを使用し、コアノードはオンデマンドインスタンスで構成してPySparkジョブを実行する
✓ 正解
Amazon EMRはSparkバージョンの自由な選択とブートストラップによるカスタムライブラリ導入をサポートします。タスクノードへのスポットインスタンス活用でコストを最大90%削減しながら、コアノードのオンデマンドで処理の安定性を確保できます。
CAWS Batchでマネージドコンピューティング環境を作成し、PySpark処理ロジックをDockerコンテナに内包して実行する
AWS BatchはSparkをDockerコンテナで実行できますが、YARNによるリソース管理・動的スケーリング・Sparkクラスターの効率的な管理機能がありません。100TBを超えるデータを対象とした大規模Sparkジョブの最適化にはEMRが適しています。
DAmazon Athenaのフェデレーテッドクエリ機能でS3上のデータにSQLを実行し、ユーザー定義関数(UDF)で集計処理を実装する
Amazon AthenaはサーバーレスSQLクエリサービスであり、UDF機能を持ちますが、カスタムPySparkライブラリを使用した機械学習前処理のような複雑なバッチ処理には設計上対応していません。
解説
Amazon EMRはHadoop/Sparkなど主要なビッグデータフレームワークをマネージド環境で実行できるサービスです。Sparkのバージョンを自由に選択でき、任意のPythonライブラリやカスタムパッケージをブートストラップアクションで導入できます。コスト最適化のために、安定性が求められるコアノードはオンデマンドインスタンスで確保しつつ、追加の計算能力を担うタスクノードにスポットインスタンスを活用することで、オンデマンド比最大90%のコスト削減が可能です。
選択肢AのAWS GlueはフルマネージドETLサービスですが、サポートするSparkバージョンと使用可能なライブラリが制限されており、特定バージョンへのピン留めや非対応カスタムライブラリの導入は実質的に困難です。
選択肢CのAWS Batchはコンテナベースのバッチ処理に適していますが、YARNによるリソース管理・動的スケーリング・Sparkクラスター管理機能がなく、100TB規模のSparkジョブ最適化には不向きです。
選択肢DのAmazon AthenaはサーバーレスSQLクエリサービスであり、カスタムPySparkライブラリを使った複雑な機械学習前処理バッチには設計上対応していません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →