無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

あるECサイトのMLチームが、Amazon RDSの顧客マスタテーブルとAmazon S3のクリックログをJOINして、推薦モデルの学習データを毎日自動生成するパイプラインを構築しています。処理内容は欠損値補完・型変換・特徴量生成で、結果はS3に書き出します。複数データソースのスキーマを一元管理しながら、サーバーレスかつスケジュール自動実行できる構成として最も適切なアプローチはどれですか?

A
AWS Glue ETLジョブ(Dynamic Frames)でRDS・S3をJOINし、Glue Data Catalogでスキーマを一元管理、EventBridgeで日次自動起動する
✓ 正解
複数データソース(RDS・S3)のJOINと変換をDynamic Framesで柔軟に実装でき、Glue Data Catalogでスキーマを一元管理できます。サーバーレスでスケールし、EventBridgeとの組み合わせで日次スケジュール実行が容易に実現できます。
B
SageMaker Data Wranglerでビジュアルフローを作成し、毎日EventBridgeからノートブックジョブとしてエクスポート・実行する
Data WranglerはGUIベースのインタラクティブなデータ前処理ツールであり、本番ETLパイプラインの自動スケジュール実行を主目的として設計されていません。EventBridgeからノートブックジョブとして実行する方法は設定が複雑で、複数ソースの大規模日次ETLには適しません。
C
AWS Glue DataBrewでノーコードの変換レシピを作成し、RDSとS3のJOINを含む全処理をDataBrewプロジェクトで実行する
DataBrewはビジュアルなデータクレンジング・変換ツールで基本的なJOINは可能ですが、複数ステップの特徴量エンジニアリングを含む複雑なETLロジックや複数データソースのスキーマ一元管理にはGlue ETLが優れています。
D
EC2インスタンス上でPythonスクリプトをcronジョブとして実行し、boto3でRDSとS3からデータを取得してETL処理を行う
EC2 cronはサーバーレスではなく、インスタンスの管理・維持コストと運用負荷が発生します。需要の変動に応じた自動スケーリングも難しく、スケーラブルかつサーバーレスな構成という要件を満たしません。

解説

AWS Glue ETLジョブはDynamic Framesを使って複数データソース(RDS・S3)のJOINやクレンジングを自動化でき、Glue Data Catalogでスキーマ・メタデータを一元管理できます。サーバーレスでスケールし、EventBridgeと組み合わせた日次自動実行も容易です。 選択肢BのSageMaker Data WranglerはGUIベースのインタラクティブなデータ前処理ツールであり、本番ETLパイプラインの自動スケジュール実行を主目的として設計されていないため、複数ソースのJOINを含む日次自動ETLには適しません。 選択肢CのAWS Glue DataBrewはビジュアルなデータクレンジングツールで基本的なJOINは可能ですが、複数ステップの特徴量エンジニアリングや複数データソースのスキーマ一元管理にはGlue ETLが優れています。 選択肢DのEC2 cronは運用負荷が高くスケーラビリティに欠けます。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る