ある企業はAmazon S3に保存された数TB規模の学習データを定期的に変換しています。サーバー管理の負担を最小限にしながらETL処理を実行したい場合、最も適切なサービスはどれですか。
AWS GlueはAWSのサーバーレスデータ統合サービスであり、インフラのプロビジョニングや管理を行うことなく大規模なETL処理を実行できます。Glue Crawlerを使用してS3上のデータスキーマを自動検出し、Glue Jobで定期的な変換・ロード処理をスケジュール実行することが可能です。数TB規模のデータにも自動スケーリングで対応でき、機械学習パイプラインのデータ準備に広く利用されています。 選択肢BのAmazon EMRはHadoop・SparkなどのビッグデータフレームワークをEC2クラスター上で実行するサービスです。大規模並列処理には対応できますが、クラスターの起動・設定・管理が必要であり、「サーバー管理の負担を最小限に」という要件を満たしません。 選択肢CのAWS Batchはコンテナベースのバッチジョブを管理するサービスです。ETL処理の実装も可能ですが、コンテナイメージの作成とジョブ定義の管理が必要であり、Glueと比較してサーバーレスの恩恵を十分に受けられません。 選択肢DのAmazon SageMaker Processingは機械学習モデルの前処理・後処理・評価に特化したジョブ実行環境であり、汎用的なデータ変換ETLパイプラインの構築・管理には最適化されていません。