無限ノック › DEA 練習問題一覧 › 問題
DEAデータオペレーションとサポート

あるデータエンジニアリングチームは、Amazon S3に蓄積された数千万行の販売データを定期的に分析し、列ごとのNULL値率・値の分布・外れ値の割合などのデータ品質統計情報を収集してレポート化したいと考えています。専門的なコードを書かずにビジュアルなデータプロファイリングレポートを自動生成できる最も適切なサービスはどれですか?

A
Amazon AthenaでNULL率・値の分布・外れ値を集計するSQLクエリを手動作成してスケジュール実行し、結果をAmazon QuickSightのダッシュボードで可視化する
Amazon Athena + QuickSightは有効な組み合わせですが、NULL率・分布・外れ値を集計するSQLクエリを手動で作成する必要があり、「コードを書かずに」という要件を満たせません。
B
AWS Glue DataBrewのプロファイルジョブをデータセットに対して設定し、コードなしでNULL率・値の分布・外れ値などの統計情報を自動収集してビジュアルレポートを生成する
✓ 正解
AWS Glue DataBrewのプロファイルジョブはコード不要で列ごとのNULL率・分布・外れ値などを自動収集し、ビジュアルレポートとして確認できます。スケジュール設定も可能で定期的なデータ品質監視に最適です。
C
AWS Glueクローラーをスケジュール設定してS3データセットのスキーマを定期更新し、Glueデータカタログのテーブル詳細ページで列ごとのメタデータ情報を確認する
AWS Glueクローラーはデータスキーマ(列名・データ型)を自動検出してGlueデータカタログを更新するツールであり、NULL率・値の分布・外れ値などのデータ統計情報の収集やレポート生成機能はありません。
D
Amazon SageMaker Clarifyのデータバイアス分析ジョブをスケジュール実行し、列ごとの統計情報をS3に出力してAthenaクエリで定期的に参照しレポートを作成する
Amazon SageMaker ClarifyはML特徴量のバイアス分析や予測の説明可能性を提供するツールであり、汎用的なデータプロファイリングやスケジュールベースの品質レポート生成には設計されていません。

解説

コードを書かずにビジュアルなデータプロファイリングレポートを自動生成するには、専用のノーコードプロファイリングサービスが最適です。 選択肢BのAWS Glue DataBrewのプロファイルジョブは、S3やGlueデータカタログ上のデータセットに対してコードを書かずにデータプロファイリングを実行できるマネージドサービスです。列ごとのNULL値率・値の分布ヒストグラム・重複率・最大・最小・平均・標準偏差・外れ値の割合などの統計情報を自動収集し、DataBrewコンソール上でビジュアルレポートとして確認できます。スケジュール実行も設定可能で、定期的なデータ品質モニタリングに活用できます。 選択肢AのAmazon Athena + QuickSightは有効なアプローチですが、各統計クエリをSQLで手動作成する必要があり「コードを書かずに」という要件を満たせません。またクエリ実行ごとにスキャンコストが発生します。 選択肢CのAWS Glueクローラーはスキーマ(列名・データ型)の自動検出とデータカタログ更新が目的であり、NULL率や値の分布などのデータ統計情報の収集・レポート機能はありません。 選択肢DのAmazon SageMaker ClarifyはML向けのバイアス分析・説明可能性ツールであり、汎用的なデータ品質プロファイリングや定期レポート作成には適していません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る