無限ノック › DEA 練習問題一覧 › 問題
DEAデータの取り込みと変換

あるデータエンジニアリングチームは、Amazon S3に毎週取り込まれる売上データ(CSV形式)に対して、以下の処理を自動化したいと考えています。 (1) 欠損値の検出と補完 (2) 日付フォーマットの統一(複数のフォーマットが混在) (3) 重複レコードの削除 チームのメンバーはSQLに慣れていますが、SparkやPythonのコーディング経験は限られています。最小限の開発工数でこれらの要件を実現するAWSサービスとして最も適切なものはどれですか?

A
AWS Glue DataBrewでレシピを作成し、スケジュールジョブとして自動実行するよう設定する
✓ 正解
AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスで、250以上の組み込み変換(欠損値補完・日付フォーマット統一・重複削除)を提供します。処理手順を「レシピ」として保存・再利用でき、スケジュール実行も設定可能です。SQLエンジニアでもGUIで直感的に操作できます。
B
AWS Glue Studioのビジュアルエディタ上でSpark ETLジョブを構築し、Amazon EventBridgeスケジュールでトリガーする
「AWS Glue Studio」はGlue Studioもビジュアルインターフェースを提供しますが、Spark ETLジョブの設計にはSpark処理モデルの理解が必要であり、DataBrewほどデータクレンジングに特化していません。
C
Amazon AthenaのCTAS(CREATE TABLE AS SELECT)クエリでデータをクリーニングし、別のS3バケットに書き出す
「Amazon Athena」はAthenaのCTASはSQLベースの変換には有効ですが、欠損値補完ロジックや重複削除をSQLで表現するのは複雑になる場合があり、DataBrewの組み込み機能ほど直感的ではありません。
D
AWS LambdaにPandasライブラリを含むレイヤーを追加してデータ処理を実装し、Amazon EventBridgeで週次実行する
「AWS Lambda」はLambda+Pandasでも実現可能ですが、Lambdaのタイムアウト制限(最大15分)・メモリ上限があり、大規模データでは不十分です。またコードのメンテナンス工数も発生します。

解説

AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスで、250以上の組み込み変換(欠損値補完・日付フォーマット統一・重複削除)を提供します。処理手順を「レシピ」として保存・再利用でき、スケジュール実行も設定可能です。SQLエンジニアでもGUIで直感的に操作できます。 選択肢Bの「AWS Glue Studio」はGlue Studioもビジュアルインターフェースを提供しますが、Spark ETLジョブの設計にはSpark処理モデルの理解が必要であり、DataBrewほどデータクレンジングに特化していません。 選択肢Cの「Amazon Athena」はAthenaのCTASはSQLベースの変換には有効ですが、欠損値補完ロジックや重複削除をSQLで表現するのは複雑になる場合があり、DataBrewの組み込み機能ほど直感的ではありません。 選択肢Dの「AWS Lambda」はLambda+Pandasでも実現可能ですが、Lambdaのタイムアウト制限(最大15分)・メモリ上限があり、大規模データでは不十分です。またコードのメンテナンス工数も発生します。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る