無限ノック › DEA 練習問題一覧 › 問題
DEAデータの取り込みと変換

ある医療機関では、複数の病院から毎日異なる形式のCSVファイルで患者の来院データを受信しています。データには以下の品質問題があることが判明しています。 ・日付フォーマットが病院ごとに異なる(YYYY-MM-DD、MM/DD/YYYY、YYYYMMDDなど) ・年齢フィールドに明らかな外れ値(例:-1歳、999歳)が存在する ・任意フィールドに欠損値がある データチームには、データエンジニアに加えてコーディングが得意でない統計専門のアナリストも参加しています。アナリストがコードを記述せずにデータプロファイリングと変換ルールの作成・管理ができる仕組みを構築したいと考えています。変換済みデータはAmazon S3にParquet形式で保存します。 最も適切なサービスとアプローチはどれですか?

A
AWS Glue ETLジョブにPySparkスクリプトを作成し、日付正規化・外れ値除去・欠損値補完のロジックを実装する
AWS Glue ETLジョブは柔軟な変換が可能ですが、PySpark等のコード作成・メンテナンスがデータエンジニア依存となり、アナリストが独立して管理できません。
B
AWS Glue DataBrewでデータセットを定義し、ビジュアルレシピで変換ルールを作成してジョブとして実行する
✓ 正解
AWS Glue DataBrewはコードを書かずにビジュアルインターフェースでデータプロファイリングと変換を行えるマネージドサービスです。250以上の組み込み変換(日付フォーマット統一・外れ値フラグ付け・欠損値補完など)をGUIで選択・組み合わせてレシピとして保存し、繰り返し実行できます。コーディング不要でアナリストが変換ルールを自律的に管理でき、出力形式としてParquetも指定可能です。
C
Amazon EMR上のApache SparkでMLlibを使った外れ値検出パイプラインを構築する
Amazon EMRはビッグデータ処理に強力ですが、クラスター管理が必要でオーバースペックであり、ノーコードのビジュアルインターフェースもありません。
D
AWS Lambdaにカスタム変換スクリプトを実装し、S3イベント通知をトリガーに自動実行する
AWS Lambdaもカスタムコードが必要で、アナリストには利用できず、複雑な変換ルールの管理・再利用にも適していません。

解説

AWS Glue DataBrewはコードを書かずにビジュアルインターフェースでデータプロファイリングと変換を行えるマネージドサービスです。250以上の組み込み変換(日付フォーマット統一・外れ値フラグ付け・欠損値補完など)をGUIで選択・組み合わせてレシピとして保存し、繰り返し実行できます。コーディング不要でアナリストが変換ルールを自律的に管理でき、出力形式としてParquetも指定可能です。 選択肢AのAWS Glue ETLジョブは柔軟な変換が可能ですが、PySpark等のコード作成・メンテナンスがデータエンジニア依存となり、アナリストが独立して管理できません。 選択肢CのAmazon EMRはビッグデータ処理に強力ですが、クラスター管理が必要でオーバースペックであり、ノーコードのビジュアルインターフェースもありません。 選択肢DのAWS Lambdaもカスタムコードが必要で、アナリストには利用できず、複雑な変換ルールの管理・再利用にも適していません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る