無限ノック › DEA 練習問題一覧 › 問題
DEAデータオペレーションとサポート

あるデータエンジニアリングチームは、AWS Glue ETLパイプラインにデータ品質チェックを組み込みたいと考えています。Amazon S3に格納されたCSVデータをAmazon Redshiftにロードする前に、「特定の列のNULL値が5%未満であること」および「数値列の値が0以上であること」というルールを定義し、違反したレコードを別のS3バケットに自動的に振り分けたいと考えています。この要件を最もシンプルかつAWSネイティブな方法で実現するサービス・機能はどれですか?

A
AWS Glue Data Quality(DQDL: Data Quality Definition Language)を使用してルールセットを定義し、Glue ETLジョブのデータ品質変換として適用する
✓ 正解
AWS Glue Data Quality はDQDL(Data Quality Definition Language)を使用してデータ品質ルールを宣言的に定義できるAWSネイティブ機能です。Glue ETLジョブ内でデータ品質変換として統合でき、ルール違反レコードを別の出力先(S3)に自動的に振り分けることが可能です。
B
AWS Lambda を使用してカスタム検証ロジックを実装し、ルール違反時にAmazon SNS経由でアラートを送信する
AWS Lambda はカスタムコードの開発・メンテナンスが必要であり、Lambdaコードの管理コストが増加します。最もシンプルかつAWSネイティブな方法ではありません。
C
Amazon EMR 上でApache Sparkのカスタム検証コードを実行し、違反レコードを別のS3パスへフィルタリング書き出しする
Amazon EMR は大規模分散処理向けのサービスであり、このユースケースでは過剰なリソースとなります。
D
Amazon Data Firehose のデータ変換機能でAWS Lambda を呼び出してレコード検証を行い、失敗レコードを別のデリバリーストリームに転送する
Amazon Data Firehose はストリーミングデータ向けのサービスであり、バッチETLパイプラインの要件には適しません。

解説

AWS Glue Data Quality はDQDL(Data Quality Definition Language)を使用してデータ品質ルールを宣言的に定義できるAWSネイティブ機能です。Glue ETLジョブ内でデータ品質変換として統合でき、ルール違反レコードを別の出力先(S3)に自動的に振り分けることが可能です。 選択肢Bは実装可能ですが、Lambdaコードの管理コストが増加し、最もシンプルかつAWSネイティブな方法ではありません。 選択肢CのEMRは大規模分散処理向けのサービスであり、このユースケースでは過剰なリソースとなります。 選択肢DのAmazon Data Firehoseはストリーミングデータ向けのサービスであり、バッチETLパイプラインの要件には適しません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る