無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

ある企業はAmazon S3に保存された数TB規模の学習データを定期的に変換しています。サーバー管理の負担を最小限にしながらETL処理を実行したい場合、最も適切なサービスはどれですか。

A
AWS Glue
✓ 正解
サーバーレスのETLサービスであり、インフラ管理不要でS3上の数TB規模のデータ変換とカタログ管理を実現できる。Glue Crawlerによるスキーマ自動検出とGlue Jobによる定期スケジュール実行により、サーバー管理負担を最小化しながらETL要件を満たす最適な選択肢。
B
Amazon EMR
Hadoop/SparkクラスターをEC2上で実行するサービスであり、クラスターの起動・設定・スケーリング管理が必要となる。大規模処理には対応できるが、サーバー管理の負担を最小限にするという要件を満たさないため不適切。
C
AWS Batch
コンテナベースのバッチジョブ管理サービス。ETL処理の実装は可能だが、コンテナイメージの構築とジョブ定義の管理が必要であり、完全なサーバーレス運用という観点でGlueより管理コストが高くなる。
D
Amazon SageMaker Processing
機械学習モデルの前処理・評価に特化した処理環境であり、汎用的なETLデータ変換パイプラインの構築には設計されていない。MLワークフロー内の特定ステップには適しているが、定期的な大規模データ変換の管理には不向き。

解説

AWS GlueはAWSのサーバーレスデータ統合サービスであり、インフラのプロビジョニングや管理を行うことなく大規模なETL処理を実行できます。Glue Crawlerを使用してS3上のデータスキーマを自動検出し、Glue Jobで定期的な変換・ロード処理をスケジュール実行することが可能です。数TB規模のデータにも自動スケーリングで対応でき、機械学習パイプラインのデータ準備に広く利用されています。 選択肢BのAmazon EMRはHadoop・SparkなどのビッグデータフレームワークをEC2クラスター上で実行するサービスです。大規模並列処理には対応できますが、クラスターの起動・設定・管理が必要であり、「サーバー管理の負担を最小限に」という要件を満たしません。 選択肢CのAWS Batchはコンテナベースのバッチジョブを管理するサービスです。ETL処理の実装も可能ですが、コンテナイメージの作成とジョブ定義の管理が必要であり、Glueと比較してサーバーレスの恩恵を十分に受けられません。 選択肢DのAmazon SageMaker Processingは機械学習モデルの前処理・後処理・評価に特化したジョブ実行環境であり、汎用的なデータ変換ETLパイプラインの構築・管理には最適化されていません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る