DEAデータの取り込みと変換
リレーショナルデータベースであるAmazon Aurora MySQLで管理されているトランザクションデータを、Amazon Redshiftでニアリアルタイムに分析したいと考えています。データエンジニアリングチームは、継続的なデータ抽出・変換・ロード(ETL)のためのパイプラインを独自に開発および保守するリソースがありません。運用負荷が最も低く、データの遅延を最小限に抑えるアーキテクチャはどれですか。
AAWS Database Migration Service (DMS) を使用して、AuroraからRedshiftへの継続的レプリケーションタスクを実行する
AWS Database Migration Service (DMS) を使用したレプリケーションは有効な手段ですが、レプリケーションインスタンスのプロビジョニングやタスクの構成・監視が必要となり、ゼロETL統合と比較して運用オーバーヘッドが増加します。
BAuroraとRedshift間のゼロETL統合を設定し、トランザクションデータが自動的にRedshiftに同期されるようにする
✓ 正解
Amazon AuroraとRedshiftのゼロETL統合機能を使用すると、インフラの構築やカスタムコードの管理なしにトランザクションデータを数秒以内に自動でRedshiftに同期できるため、運用負荷を最小限に抑えつつニアリアルタイム分析を実現できます。
CAuroraのバックアップをS3にエクスポートし、RedshiftのCOPYコマンドをスケジュール実行するLambdaを作成する
AuroraのバックアップをS3にエクスポートしてLambdaでRedshiftにロードするバッチ処理アーキテクチャでは、データの同期に時間がかかり、要件であるニアリアルタイムな分析および運用オーバーヘッドの最小化を達成することができません。
DAWS GlueクローラでAuroraのスキーマを取得し、Glue ETLジョブを毎分実行してRedshiftにロードする
AWS GlueクローラとETLジョブを毎分実行するようにスケジューリングすると、不必要なコンピューティングコストが発生するだけでなく、データパイプライン自体の保守と監視が必要となり、運用負荷をゼロにするという本来の目的に反してしまいます。
解説
Amazon AuroraとAmazon RedshiftのゼロETL統合は、トランザクションデータに対してニアリアルタイムの分析と機械学習を可能にする機能です。この機能を有効にすると、データパイプラインを構築・維持するためのインフラストラクチャやカスタムコードの管理が不要になり、Auroraに書き込まれたデータは通常数秒以内にRedshiftに自動的に同期されます。AWS DMSを使用したレプリケーションは効果的ですが、レプリケーションインスタンスのプロビジョニングや監視が必要となるため、ゼロETL統合に比べて運用オーバーヘッドが増加します。S3へのエクスポートやGlueを用いた毎分のETLジョブ実行は、遅延の増加と高額なコスト、保守の手間を生むため非効率です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →