MLA機械学習のためのデータ準備
あるECサイトのMLチームが、Amazon RDSの顧客マスタテーブルとAmazon S3のクリックログをJOINして、推薦モデルの学習データを毎日自動生成するパイプラインを構築しています。処理内容は欠損値補完・型変換・特徴量生成で、結果はS3に書き出します。複数データソースのスキーマを一元管理しながら、サーバーレスかつスケジュール自動実行できる構成として最も適切なアプローチはどれですか?
AAWS Glue ETLジョブ(Dynamic Frames)でRDS・S3をJOINし、Glue Data Catalogでスキーマを一元管理、EventBridgeで日次自動起動する
✓ 正解
複数データソース(RDS・S3)のJOINと変換をDynamic Framesで柔軟に実装でき、Glue Data Catalogでスキーマを一元管理できます。サーバーレスでスケールし、EventBridgeとの組み合わせで日次スケジュール実行が容易に実現できます。
BSageMaker Data Wranglerでビジュアルフローを作成し、毎日EventBridgeからノートブックジョブとしてエクスポート・実行する
Data WranglerはGUIベースのインタラクティブなデータ前処理ツールであり、本番ETLパイプラインの自動スケジュール実行を主目的として設計されていません。EventBridgeからノートブックジョブとして実行する方法は設定が複雑で、複数ソースの大規模日次ETLには適しません。
CAWS Glue DataBrewでノーコードの変換レシピを作成し、RDSとS3のJOINを含む全処理をDataBrewプロジェクトで実行する
DataBrewはビジュアルなデータクレンジング・変換ツールで基本的なJOINは可能ですが、複数ステップの特徴量エンジニアリングを含む複雑なETLロジックや複数データソースのスキーマ一元管理にはGlue ETLが優れています。
DEC2インスタンス上でPythonスクリプトをcronジョブとして実行し、boto3でRDSとS3からデータを取得してETL処理を行う
EC2 cronはサーバーレスではなく、インスタンスの管理・維持コストと運用負荷が発生します。需要の変動に応じた自動スケーリングも難しく、スケーラブルかつサーバーレスな構成という要件を満たしません。
解説
AWS Glue ETLジョブはDynamic Framesを使って複数データソース(RDS・S3)のJOINやクレンジングを自動化でき、Glue Data Catalogでスキーマ・メタデータを一元管理できます。サーバーレスでスケールし、EventBridgeと組み合わせた日次自動実行も容易です。
選択肢BのSageMaker Data WranglerはGUIベースのインタラクティブなデータ前処理ツールであり、本番ETLパイプラインの自動スケジュール実行を主目的として設計されていないため、複数ソースのJOINを含む日次自動ETLには適しません。
選択肢CのAWS Glue DataBrewはビジュアルなデータクレンジングツールで基本的なJOINは可能ですが、複数ステップの特徴量エンジニアリングや複数データソースのスキーマ一元管理にはGlue ETLが優れています。
選択肢DのEC2 cronは運用負荷が高くスケーラビリティに欠けます。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →