無限ノック › DEA 練習問題一覧 › 問題
DEAデータの取り込みと変換

あるデータエンジニアリングチームは、Amazon S3に蓄積された複数形式(CSV、JSON)の生データを分析用に準備する必要があります。以下の要件があります。 ・コードを書かずにビジュアル操作でデータのクレンジング、型変換、外れ値の処理を行いたい ・データプロファイリングにより欠損値の割合や値の分布を自動的に可視化したい ・処理後のデータはApache Parquet形式でS3に出力したい ・Pythonスキルが限定的なデータアナリストが日常的に作業できる環境が必要 この要件を最も適切に満たすAWSサービスはどれですか?

A
AWS Glue ETL ジョブ(PySpark)を使用してS3のデータを変換する
Glue ETLジョブ(PySpark)はPythonコーディングが必要であり、スキルが限定的なアナリストが作業する要件を満たしません。
B
Amazon EMR(Apache Spark)クラスターで変換スクリプトを実行する
EMR(Apache Spark)はクラスター管理とSparkコーディングが必要で、非エンジニア向けの環境としては運用・学習コストが高すぎます。
C
AWS Glue DataBrew を使用してビジュアルレシピでデータを準備する
✓ 正解
AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスです。250以上の組み込み変換(型変換・欠損値補完・正規化・外れ値処理等)をGUI操作で適用でき、データプロファイリング機能により欠損率・値分布・相関を自動可視化します。処理結果をParquet等の形式でS3に出力する機能も標準搭載しており、非エンジニアのアナリストでも日常的に操作できます。
D
AWS Glue Studio のビジュアルETLを使用してデータ変換パイプラインを構築する
Glue StudioはビジュアルETLパイプラインを構築できますが、データプロファイリング機能を持たず、エンジニア向けのETLジョブ設計ツールです。アナリストが日常的なデータクレンジング作業を行う用途にはDataBrewが適しています。

解説

AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスです。250以上の組み込み変換(型変換・欠損値補完・正規化・外れ値処理等)をGUI操作で適用でき、データプロファイリング機能により欠損率・値分布・相関を自動可視化します。処理結果をParquet等の形式でS3に出力する機能も標準搭載しており、非エンジニアのアナリストでも日常的に操作できます。 選択肢AのGlue ETLジョブ(PySpark)はPythonコーディングが必要であり、スキルが限定的なアナリストが作業する要件を満たしません。 選択肢BのEMR(Apache Spark)はクラスター管理とSparkコーディングが必要で、非エンジニア向けの環境としては運用・学習コストが高すぎます。 選択肢DのGlue StudioはビジュアルETLパイプラインを構築できますが、データプロファイリング機能を持たず、エンジニア向けのETLジョブ設計ツールです。アナリストが日常的なデータクレンジング作業を行う用途にはDataBrewが適しています。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る