DEAデータオペレーションとサポート

あるデータエンジニアリングチームは本番環境でAWS Glue ETLジョブを1日数回実行している。ジョブ失敗を即座に検知してオンコール担当者にページング通知を送ること、および正常完了しているジョブの所要時間が徐々に増加するトレンドを検知してアラートを受け取ることの2点を、最小の追加コードで実現したい。

A
EventBridgeでGlue ETLのFAILEDイベントをSNSに転送してページングを設定し、CloudWatchでglue.driver.aggregate.elapsedTimeにトレンドアラームを設定する
✓ 正解
Amazon EventBridgeはGlueジョブの状態変化を即時に検知してSNSに転送でき、CloudWatchメトリクスで所要時間トレンドも追加コードなしで監視できる。
B
CloudWatch Logs InsightsでGlueのエラーログを5分ごとにスケジュールクエリしSNSアラームを設定し、別途AthenaでジョブログをクエリしてトレンドをCSV出力する
CloudWatch Logs Insightsのスケジュールクエリには最短でも数分の遅延があり、即座のページング通知という要件を満たせない。
C
Glueジョブ完了後にLambdaで実行履歴をDynamoDBに記録し、QuickSightでトレンドを可視化してEventBridge Schedulerで定期的にSNS通知を送信する
AWS LambdaとAmazon DynamoDBとAmazon QuickSightの組み合わせは追加インフラと開発工数が多く、最小追加コードの要件に反する。
D
AWS CloudTrailでStartJobRun APIコールを記録してAthenaでクエリしエラー率を算出し、所要時間トレンドをSNSアラームで通知する
AWS CloudTrailはAPIコールの記録に特化しており、Glueジョブの実行所要時間メトリクスを直接取得することはできない。

解説

EventBridgeはGlueジョブの状態変化(FAILED等)をコードなしで即時SNS転送でき、CloudWatchのelapsedTimeメトリクスとアラームで所要時間のトレンド変化も自動検出できる。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
DEA の問題一覧に戻る