DEAデータの取り込みと変換
あるデータエンジニアリングチームは、Amazon S3に毎週取り込まれる売上データ(CSV形式)に対して、以下の処理を自動化したいと考えています。
(1) 欠損値の検出と補完
(2) 日付フォーマットの統一(複数のフォーマットが混在)
(3) 重複レコードの削除
チームのメンバーはSQLに慣れていますが、SparkやPythonのコーディング経験は限られています。最小限の開発工数でこれらの要件を実現するAWSサービスとして最も適切なものはどれですか?
AAWS Glue DataBrewでレシピを作成し、スケジュールジョブとして自動実行するよう設定する
✓ 正解
AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスで、250以上の組み込み変換(欠損値補完・日付フォーマット統一・重複削除)を提供します。処理手順を「レシピ」として保存・再利用でき、スケジュール実行も設定可能です。SQLエンジニアでもGUIで直感的に操作できます。
BAWS Glue Studioのビジュアルエディタ上でSpark ETLジョブを構築し、Amazon EventBridgeスケジュールでトリガーする
「AWS Glue Studio」はGlue Studioもビジュアルインターフェースを提供しますが、Spark ETLジョブの設計にはSpark処理モデルの理解が必要であり、DataBrewほどデータクレンジングに特化していません。
CAmazon AthenaのCTAS(CREATE TABLE AS SELECT)クエリでデータをクリーニングし、別のS3バケットに書き出す
「Amazon Athena」はAthenaのCTASはSQLベースの変換には有効ですが、欠損値補完ロジックや重複削除をSQLで表現するのは複雑になる場合があり、DataBrewの組み込み機能ほど直感的ではありません。
DAWS LambdaにPandasライブラリを含むレイヤーを追加してデータ処理を実装し、Amazon EventBridgeで週次実行する
「AWS Lambda」はLambda+Pandasでも実現可能ですが、Lambdaのタイムアウト制限(最大15分)・メモリ上限があり、大規模データでは不十分です。またコードのメンテナンス工数も発生します。
解説
AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスで、250以上の組み込み変換(欠損値補完・日付フォーマット統一・重複削除)を提供します。処理手順を「レシピ」として保存・再利用でき、スケジュール実行も設定可能です。SQLエンジニアでもGUIで直感的に操作できます。
選択肢Bの「AWS Glue Studio」はGlue Studioもビジュアルインターフェースを提供しますが、Spark ETLジョブの設計にはSpark処理モデルの理解が必要であり、DataBrewほどデータクレンジングに特化していません。
選択肢Cの「Amazon Athena」はAthenaのCTASはSQLベースの変換には有効ですが、欠損値補完ロジックや重複削除をSQLで表現するのは複雑になる場合があり、DataBrewの組み込み機能ほど直感的ではありません。
選択肢Dの「AWS Lambda」はLambda+Pandasでも実現可能ですが、Lambdaのタイムアウト制限(最大15分)・メモリ上限があり、大規模データでは不十分です。またコードのメンテナンス工数も発生します。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →