DEAデータの取り込みと変換
あるメディア企業のデータアナリストチームは、複数のパートナー企業から毎月Amazon S3に届く視聴率レポート(CSV形式)を処理しています。ファイルには欠損値・混在する日付フォーマット(YYYY-MM-DD と MM/DD/YYYY)・重複レコードの問題があります。チームはPythonやSparkの開発スキルを持たず、コードを書かずにデータをプロファイリング・クリーニング・正規化して、Amazon Redshiftにロードしたいと考えています。この要件に最も適したAWSサービスはどれですか?
AAWS Glue Studio(ビジュアルETLエディタ)を使用してジョブを作成する
AWS Glue StudioはビジュアルETLジョブ構築ツールだが、変換ノードの設定に技術的知識が必要でDataBrewのような専用クリーニングUIを持たない。欠損値処理・日付フォーマット統一などを直感的にGUI操作で適用する機能が不足しており、非エンジニアには難しい。
BAWS Glue DataBrewを使用してビジュアルでデータをプロファイリング・クリーニングする
✓ 正解
コーディング不要のビジュアルデータ準備サービスで、280以上のビルトイン変換(日付フォーマット統一・欠損値補完・重複削除)をGUI操作で適用できる。プロファイリング機能で問題箇所を自動可視化でき、変換手順をレシピとして保存・再利用も可能で非エンジニアに最適。
CAmazon SageMaker Data Wranglerを使用してデータを準備する
Amazon SageMaker Data WranglerはMLモデル開発のための特徴量エンジニアリングに特化したサービスで、SageMaker環境と機械学習の知識が前提となる。汎用的なデータクリーニングやRedshiftへの直接ロードを主目的とする本要件には適さない。
DAmazon Athenaのinsert into...selectクエリでデータクリーニングを行う
Amazon AthenaはSQLクエリを記述して実行するサービスで「コードを書かずに」という要件を満たせない。INSERT INTO...SELECT文によるデータ変換はSQLスキルが必要であり、データプロファイリング機能も持たないため本要件には不適切。
解説
AWS Glue DataBrewは、コーディング不要のビジュアルデータ準備サービスです。280以上のビルトイン変換(日付フォーマット統一・欠損値補完/除去・重複削除・文字列正規化など)をGUI操作で適用でき、非エンジニアのデータアナリストが直感的に使用できます。データプロファイリング機能により列の欠損率・値分布・統計を自動可視化し、問題箇所を素早く特定できます。作成した変換手順は「レシピ」として保存・再利用でき、新規ファイル到着時のスケジュール実行も可能です。
選択肢AのAWS Glue StudioはビジュアルでのETLジョブ構築をサポートしますが、ノード接続や設定に技術的知識が必要で、DataBrewのような専用データクリーニングUIを持たない。
選択肢CのAmazon SageMaker Data WranglerはML特徴量エンジニアリングに特化しSageMaker環境が必要なため、汎用データクリーニングにはDataBrewの方が適切。
選択肢DのAmazon AthenaはSQLクエリの記述が必要であり、コーディングスキルがないチームの要件を満たさない。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →