DEAデータオペレーションとサポート
あるデータエンジニアリングチームは、Amazon S3に蓄積された数千万行の販売データを定期的に分析し、列ごとのNULL値率・値の分布・外れ値の割合などのデータ品質統計情報を収集してレポート化したいと考えています。専門的なコードを書かずにビジュアルなデータプロファイリングレポートを自動生成できる最も適切なサービスはどれですか?
AAmazon AthenaでNULL率・値の分布・外れ値を集計するSQLクエリを手動作成してスケジュール実行し、結果をAmazon QuickSightのダッシュボードで可視化する
Amazon Athena + QuickSightは有効な組み合わせですが、NULL率・分布・外れ値を集計するSQLクエリを手動で作成する必要があり、「コードを書かずに」という要件を満たせません。
BAWS Glue DataBrewのプロファイルジョブをデータセットに対して設定し、コードなしでNULL率・値の分布・外れ値などの統計情報を自動収集してビジュアルレポートを生成する
✓ 正解
AWS Glue DataBrewのプロファイルジョブはコード不要で列ごとのNULL率・分布・外れ値などを自動収集し、ビジュアルレポートとして確認できます。スケジュール設定も可能で定期的なデータ品質監視に最適です。
CAWS Glueクローラーをスケジュール設定してS3データセットのスキーマを定期更新し、Glueデータカタログのテーブル詳細ページで列ごとのメタデータ情報を確認する
AWS Glueクローラーはデータスキーマ(列名・データ型)を自動検出してGlueデータカタログを更新するツールであり、NULL率・値の分布・外れ値などのデータ統計情報の収集やレポート生成機能はありません。
DAmazon SageMaker Clarifyのデータバイアス分析ジョブをスケジュール実行し、列ごとの統計情報をS3に出力してAthenaクエリで定期的に参照しレポートを作成する
Amazon SageMaker ClarifyはML特徴量のバイアス分析や予測の説明可能性を提供するツールであり、汎用的なデータプロファイリングやスケジュールベースの品質レポート生成には設計されていません。
解説
コードを書かずにビジュアルなデータプロファイリングレポートを自動生成するには、専用のノーコードプロファイリングサービスが最適です。
選択肢BのAWS Glue DataBrewのプロファイルジョブは、S3やGlueデータカタログ上のデータセットに対してコードを書かずにデータプロファイリングを実行できるマネージドサービスです。列ごとのNULL値率・値の分布ヒストグラム・重複率・最大・最小・平均・標準偏差・外れ値の割合などの統計情報を自動収集し、DataBrewコンソール上でビジュアルレポートとして確認できます。スケジュール実行も設定可能で、定期的なデータ品質モニタリングに活用できます。
選択肢AのAmazon Athena + QuickSightは有効なアプローチですが、各統計クエリをSQLで手動作成する必要があり「コードを書かずに」という要件を満たせません。またクエリ実行ごとにスキャンコストが発生します。
選択肢CのAWS Glueクローラーはスキーマ(列名・データ型)の自動検出とデータカタログ更新が目的であり、NULL率や値の分布などのデータ統計情報の収集・レポート機能はありません。
選択肢DのAmazon SageMaker ClarifyはML向けのバイアス分析・説明可能性ツールであり、汎用的なデータ品質プロファイリングや定期レポート作成には適していません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →