CLFクラウドのテクノロジーとサービス

ある企業のデータエンジニアリングチームが、Amazon S3・Amazon RDS・Amazon DynamoDBなど複数のデータソースに散在するデータを統合し、定期的にETL(Extract, Transform, Load:抽出・変換・ロード)処理を行いたいと考えています。サーバーを管理せずに、データカタログの自動作成とETLジョブの実行が必要です。最も適切なサービスはどれですか?

A
Amazon EMR
Amazon EMRはApache SparkやHadoopなどの分散処理フレームワークを実行するマネージドサービスですが、クラスターの設定・管理が必要でサーバーレスではないため、サーバー管理不要という要件に合致しません。
B
AWS Glue
✓ 正解
AWS Glueはサーバーレスのデータ統合サービスで、クローラーによるデータカタログの自動作成とETLジョブの実行をサーバー管理なしで行え、複数データソースの統合に最適です。
C
Amazon Data Firehose
Amazon Data Firehoseはリアルタイムのストリーミングデータ取り込み・配信に特化したサービスで、定期的なバッチETL処理やデータカタログ作成の用途には適しません。
D
Amazon Redshift
Amazon Redshiftは分析クエリ向けのデータウェアハウスサービスであり、ETLジョブの実行やデータカタログの自動作成という役割は担いません。

解説

AWS Glueはサーバーレスのデータ統合サービスで、クローラーによるデータカタログの自動作成とETLジョブの実行をサーバー管理なしで行えます。複数のデータソースに散在するデータの統合に最適です。 選択肢「Amazon EMR」はApache SparkやHadoopなどの分散処理フレームワークを実行するマネージドサービスですが、クラスターの設定・管理が必要でサーバーレスではありません。 選択肢「Amazon Data Firehose」はリアルタイムのストリーミングデータ取り込み・配信に特化しており、定期バッチETL処理とは異なる用途です。 選択肢「Amazon Redshift」はデータウェアハウスサービスであり、ETLツール・データカタログの役割は担いません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでCLFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
CLF の問題一覧に戻る