DEAデータの取り込みと変換
ある小売企業のマーケティングチームは、プログラミングスキルのないビジネスアナリストが、Amazon S3に保存された顧客データのクレンジングと標準化を行う必要があります。データには日付形式の不統一、重複レコード、欠損値などの問題があります。アナリストは、コードを書かずに再利用可能なデータ変換処理を作成し、定期的に適用できる仕組みを求めています。この要件を最も効果的に満たすAWSサービスはどれですか?
AAWS Glue DataBrew でビジュアルレシピを作成し、スケジュール実行するジョブに適用する
✓ 正解
コード不要のビジュアルデータ準備ツールで250以上の組み込み変換を提供します。日付形式統一・重複削除・欠損値補完などの処理を「レシピ」として保存・再利用でき、スケジュールジョブ実行も可能です。プログラミングスキル不要でビジネスアナリストが直接操作できます。
BAWS Glue Studio でビジュアルETLパイプラインを構築し、Apache Sparkスクリプトを生成する
ビジュアルUIを提供しますが、Apache SparkベースのETLコード生成を前提とした技術者向けツールです。生成されたSparkスクリプトの理解・修正にプログラミング知識が必要なため、コードレスで業務を進めたいビジネスアナリストには適していません。
CAmazon SageMaker Data Wrangler でデータフローを作成し、S3に出力する
機械学習のフィーチャーエンジニアリングに特化したツールで、MLモデル構築パイプラインとの統合が主目的です。汎用的なデータクレンジングやスケジュール実行・レシピ再利用といったビジネスアナリスト向けのユースケースを主眼に設計されていません。
DAmazon EMR で Apache Spark ジョブを実行し、AWS Glue Data Catalog と連携してデータを変換する
Apache Sparkによる大規模分散処理が可能な強力なサービスですが、PythonやScalaなどのコード記述が必須です。クラスターの設定・管理の知識も必要となり、プログラミングスキルのないビジネスアナリストが単独で利用することはできません。
解説
AWS Glue DataBrew はコードを書かずにデータのプロファイリング、クレンジング、変換を行えるビジュアルデータ準備ツールです。250以上の組み込み変換(日付形式の統一、重複削除、欠損値補完など)が用意されており、変換手順を「レシピ」として保存して繰り返し適用できます。プログラミングスキルが不要でビジネスアナリストが直接操作できる点がこの要件に最適です。
選択肢BのAWS Glue Studioはビジュアルインターフェースを持ちますが、Sparkベースのコード生成を前提とした技術者向けツールであり、コードレスでの業務アナリスト向け利用には適していません。
選択肢CのAmazon SageMaker Data Wranglerは機械学習のフィーチャーエンジニアリングに特化しており、汎用的なデータクレンジングやビジネスアナリスト向けの操作性を目的とした設計ではありません。
選択肢DのAmazon EMRはApache Sparkによる大規模分散処理が可能ですが、コードの記述が必須であり、プログラミングスキルのないアナリストには適しません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →