無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

大手小売企業のMLチームは、Amazon Redshiftに格納された過去5年分の購買トランザクションデータ(約4TB)から需要予測モデル用の特徴量を作成したいと考えています。 移動平均・曜日別集計・カテゴリ別売上比率などのSQL変換をインタラクティブにプレビューしながら設計し、承認後に再利用可能なパイプラインとして保存・スケジュール実行したいです。 追加のインフラ管理を最小化するために最も適切な方法はどれか。

A
AWS Glue ETLジョブのRedshift JDBCコネクタでデータを抽出してPySpark変換を実装し、生成した特徴量をParquetファイルとしてS3に出力する
AWS Glue ETLは変換ロジックのコード実装が必要で、GUIによるインタラクティブなSQL変換プレビューには対応していません。変換内容を視覚的に確認しながら設計・検証するという要件を満たせません。
B
Amazon Athena Federated QueryでRedshiftを外部データソースとして参照し、CTAS構文で特徴量クエリ結果をS3にエクスポートする
Amazon Athena Federated QueryはRedshiftへのアドホッククエリに使用できますが、特徴量パイプラインのインタラクティブ設計・バージョン管理・スケジュール実行の統合機能を持たず、パイプラインの再利用性が低い方法です。
C
SageMaker Data WranglerでRedshiftデータソースに接続し、GUIでSQL変換をプレビューしながら特徴量を設計してProcessing Jobとしてエクスポート・実行する
✓ 正解
SageMaker Data WranglerはRedshiftネイティブコネクタを備え、GUIでSQL変換のリアルタイムプレビューが可能です。設計した変換フローはProcessing Jobとしてエクスポートでき、SageMaker Pipelinesへの組み込みや定期スケジュール実行も容易に実現できます。
D
Amazon EMRのSparkジョブでJDBCコネクタによりRedshiftからデータを取得し、PySparkで特徴量エンジニアリングを実装してS3に書き出す
Amazon EMRはカスタムSparkロジックの実装に優れていますが、クラスター構成・スケーリング・コスト管理などのインフラ運用負荷が大きく、追加のインフラ管理を最小化するという要件に適合しません。

解説

SageMaker Data Wranglerは、Amazon Redshiftをネイティブデータソースとしてサポートしており、GUIから直接Redshiftに接続してSQLクエリを実行し、変換結果をインタラクティブにプレビューできます。設計した変換パイプラインはSageMaker Processing Jobレシピとしてエクスポートでき、SageMaker Pipelinesに組み込んでスケジュール実行することも可能です。 コードを書かずにデータ変換をインタラクティブに設計・検証し、スケーラブルな処理パイプラインとして再利用できる点がこのシナリオの要件に最も合致します。追加のクラスターやインフラ管理も不要です。 選択肢AのAWS Glue ETLはコードベースの開発が必要で、変換内容をインタラクティブにプレビューしながら設計する用途には向きません。 選択肢BのAthena Federated Queryは、Redshiftへのアドホッククエリには使えますが、特徴量変換パイプラインの設計・管理・スケジュール実行の仕組みがなく運用性に欠けます。 選択肢DのAmazon EMRはSparkの柔軟性が高いですが、クラスター設計・管理・コスト最適化など追加のインフラ運用負荷が発生し、要件の「インフラ管理の最小化」に反します。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る