無限ノック › DEA 練習問題一覧 › 問題
DEAデータの取り込みと変換

あるメディア企業のマーケティングアナリストチームは、Amazon S3に蓄積されたWebログ・CRM・広告プラットフォームの顧客行動データを分析したい。データには欠損値・重複・不統一なフォーマットが多く、PythonやSQLの知識を持たないアナリストがセルフサービスでクレンジングと標準化を行い、再利用可能な変換レシピを作成したい。運用コストを最小化しながらこの要件を満たすサービスはどれか。

A
AWS Glue Studio でビジュアルETLジョブを構築し、変換ロジックをSparkコードで定義してスケジュール実行する
AWS Glue StudioはETLジョブのビジュアル作成ツールですが、変換ロジックの定義にSpark/SQL知識が必要です。非エンジニアのアナリストがセルフサービスでデータクレンジングや欠損値処理を行うのは難しく、DataBrewほどの直感的な操作性はありません。
B
AWS Glue DataBrew でノーコードのレシピを作成し、データプロファイリング後にジョブとして実行する
✓ 正解
AWS Glue DataBrewは250種類以上のビルトイン変換とデータプロファイリング機能を備えたノーコードデータ準備サービスです。GUIで作成した変換手順がレシピとして保存・再利用でき、コードを書けないアナリストでも独立してデータ品質を改善できます。
C
Amazon SageMaker Data Wrangler でデータフローを定義し、特徴量エンジニアリングパイプラインを構築する
Amazon SageMaker Data Wranglerは機械学習パイプライン向けの特徴量エンジニアリングツールであり、MLワークフローとの統合が主目的です。一般的なデータクレンジングのセルフサービス用途には機能が過剰で、コストも大きくなります。
D
Amazon Athena で CREATE TABLE AS SELECT を使用してクレンジング済みデータを別テーブルとして生成する
Amazon AthenaはSQLを使ったインタラクティブクエリサービスです。CTASでデータ変換はできますが、SQLの記述が必要で、非エンジニアが直感的に操作できる再利用可能なレシピ管理機能はありません。

解説

選択肢BのAWS Glue DataBrewは、コードを書かずに250種類以上の組み込み変換を使ってデータのプロファイリング、クレンジング、正規化を行えるビジュアルなデータ準備サービスです。GUIで操作した変換ステップが「レシピ」として保存・再利用でき、S3上のデータを直接操作できます。SQLやPythonの知識がないアナリストでも独立してデータ品質の改善が可能です。 選択肢AのAWS Glue Studioはビジュアルインターフェースを持つETLジョブ構築ツールですが、変換ロジックにSpark/SQLの知識が必要で、非エンジニアが直感的にデータプロファイリングや欠損処理を行うには適していません。 選択肢CのAmazon SageMaker Data Wranglerは機械学習パイプライン向けの特徴量エンジニアリングツールであり、MLワークフローとの統合が主目的です。一般的なデータクレンジングのセルフサービス用途には機能が過剰で高コストです。 選択肢DのAmazon AthenaはSQLベースのクエリサービスであり、コードの記述が必要です。再利用可能なレシピ管理機能もなく、非エンジニアのアナリストが主体的に操作する用途には向きません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る