無限ノック › SAA 練習問題一覧 › 問題
SAAコスト最適化されたアーキテクチャの設計複数選択

あるメディア企業は、ユーザーの視聴ログデータ(1日あたり約50GB)をリアルタイムで収集・分析したいと考えています。要件は次の通りです。 (1)データはAmazon S3に永続化する (2)マーケティングチームがSQLを使ったアドホック分析を実施する (3)データ取り込みからS3保存までのETL(Extract・Transform・Load:データの抽出・変換・ロード)処理は最小限にしたい (4)サーバーのプロビジョニング・管理はしたくない (5)コストを最小化したい これらの要件をすべて満たすために採用すべきAWSサービスを2つ選択してください。

A
Amazon Data FirehoseでS3にデータをリアルタイム配信し、Apache Parquet形式への自動変換をAWS Glueデータカタログと組み合わせて有効にする
✓ 正解
Amazon Data Firehoseはサーバーレスで、S3へのリアルタイムデータ配信が可能で、Glueデータカタログを活用してJSON→Parquet形式への自動変換ができます。列指向のParquetはAthenaのスキャン量を大幅に削減しクエリコストを最適化します。AthenaはサーバーレスSQLエンジンでスキャンしたデータ量のみ課金されるためアドホック分析に最適です。
B
Amazon Kinesis Data StreamsとAmazon EMR(Elastic MapReduce:大規模分散処理サービス)クラスターでデータを処理し、S3に保存する
Amazon Kinesis Data StreamsとAmazon EMRでデータを処理し、S3に保存する方法はクラスター管理が必要で運用負荷が高いです。
C
Amazon AthenaをS3上のデータに対するアドホックSQLクエリエンジンとして使用する
✓ 正解
Amazon Athena はサーバーレスSQLエンジンで、S3上のデータに対してスキャンしたデータ量のみ課金されます。プロビジョニング不要でSQLアドホック分析ができ、コストを最小化できます。
D
Amazon RedshiftクラスターにS3のデータをCOPYコマンドでロードし、SQLクエリを実行する
Amazon RedshiftクラスターにS3のデータをCOPYコマンドでロードする方法は常時稼働コストが高く定期的な大規模分析向けで過剰です。
E
AWS Glue ETLジョブをスケジュール実行してすべてのデータ変換処理を管理する
AWS Glue ETLジョブをスケジュール実行する方法のみでは取り込みとクエリの両要件を満たせません。

解説

Amazon Data Firehoseはサーバーレスで、S3へのリアルタイムデータ配信が可能で、Glueデータカタログを活用してJSON→Parquet形式への自動変換ができます。列指向のParquetはAthenaのスキャン量を大幅に削減しクエリコストを最適化します。AthenaはサーバーレスSQLエンジンでスキャンしたデータ量のみ課金されるためアドホック分析に最適です。 選択肢BのAmazon Kinesis Data StreamsとAmazon EMRでデータを処理し、S3に保存する方法はクラスター管理が必要で運用負荷が高いです。 選択肢DのAmazon RedshiftクラスターにS3のデータをCOPYコマンドでロードする方法は常時稼働コストが高く定期的な大規模分析向けで過剰です。 選択肢EのAWS Glue ETLジョブをスケジュール実行する方法のみでは取り込みとクエリの両要件を満たせません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでSAAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← SAA の問題一覧に戻る