あるデータエンジニアリングチームは、Amazon S3に蓄積された複数形式(CSV、JSON)の生データを分析用に準備する必要があります。以下の要件があります。 ・コードを書かずにビジュアル操作でデータのクレンジング、型変換、外れ値の処理を行いたい ・データプロファイリングにより欠損値の割合や値の分布を自動的に可視化したい ・処理後のデータはApache Parquet形式でS3に出力したい ・Pythonスキルが限定的なデータアナリストが日常的に作業できる環境が必要 この要件を最も適切に満たすAWSサービスはどれですか?
AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスです。250以上の組み込み変換(型変換・欠損値補完・正規化・外れ値処理等)をGUI操作で適用でき、データプロファイリング機能により欠損率・値分布・相関を自動可視化します。処理結果をParquet等の形式でS3に出力する機能も標準搭載しており、非エンジニアのアナリストでも日常的に操作できます。 選択肢AのGlue ETLジョブ(PySpark)はPythonコーディングが必要であり、スキルが限定的なアナリストが作業する要件を満たしません。 選択肢BのEMR(Apache Spark)はクラスター管理とSparkコーディングが必要で、非エンジニア向けの環境としては運用・学習コストが高すぎます。 選択肢DのGlue StudioはビジュアルETLパイプラインを構築できますが、データプロファイリング機能を持たず、エンジニア向けのETLジョブ設計ツールです。アナリストが日常的なデータクレンジング作業を行う用途にはDataBrewが適しています。