あるデータエンジニアリングチームは、AWS Glue ETLパイプラインにデータ品質チェックを組み込みたいと考えています。Amazon S3に格納されたCSVデータをAmazon Redshiftにロードする前に、「特定の列のNULL値が5%未満であること」および「数値列の値が0以上であること」というルールを定義し、違反したレコードを別のS3バケットに自動的に振り分けたいと考えています。この要件を最もシンプルかつAWSネイティブな方法で実現するサービス・機能はどれですか?
AWS Glue Data Quality はDQDL(Data Quality Definition Language)を使用してデータ品質ルールを宣言的に定義できるAWSネイティブ機能です。Glue ETLジョブ内でデータ品質変換として統合でき、ルール違反レコードを別の出力先(S3)に自動的に振り分けることが可能です。 選択肢Bは実装可能ですが、Lambdaコードの管理コストが増加し、最もシンプルかつAWSネイティブな方法ではありません。 選択肢CのEMRは大規模分散処理向けのサービスであり、このユースケースでは過剰なリソースとなります。 選択肢DのAmazon Data Firehoseはストリーミングデータ向けのサービスであり、バッチETLパイプラインの要件には適しません。