MLA機械学習のためのデータ準備
通信会社のMLエンジニアは、Amazon S3に蓄積された60TBのネットワークログデータから解約予測モデル用の特徴量を週次バッチ処理で作成しています。
特徴量エンジニアリングには、セッション集計・スライディングウィンドウ関数・複数テーブルの結合を含む複雑なカスタムPySparkロジックが必要です。
コストを最小化しながらこの処理を実行するために最も適切な方法はどれか。
ASageMaker Processing Jobのマネージド Sparkコンテナ(ml.m5.4xlarge × 20台)でPySparkスクリプトを実行し、ジョブ完了後インスタンスを自動停止させる
SageMaker Processing JobのSparkコンテナはマネージドSparkを提供しますが、60TBの大規模データ処理においてはEMR Spotインスタンスよりもコストパフォーマンスが低く、クラスター構成の柔軟性も制限されます。
BAWS Glue ETLジョブのPySparkモードでロジックを実装し、ワーカータイプG.2Xのオートスケーリングを設定してジョブを実行する
AWS Glue ETLはサーバーレスで運用コストが低いですが、DPU単価はEMR Spotインスタンスより高く、60TBの大量データを週次処理する場合はEMRの方がコスト効率が高くなります。
CAmazon EMRクラスターでマスターにオンデマンドインスタンス、コア・タスクノードにSpotインスタンスを使用してPySparkジョブを実行し、処理完了後にクラスターを自動終了する
✓ 正解
Amazon EMRのSpotインスタンス活用により、オンデマンド比で最大90%のコスト削減が可能です。週次バッチ処理はフォールトトレラントなため中断リスクを許容でき、Transient Clusterの自動終了でアイドルコストも排除できます。
DSageMaker Data WranglerのカスタムPySpark変換でロジックを実装し、SageMaker Pipelinesでスケジュール管理してProcessing Jobとして週次実行する
SageMaker Data WranglerのカスタムPySpark変換はGUIベースの特徴量設計ツールで、60TB規模のカスタムSparkロジックに必要なクラスタースケールの処理性能とスケーラビリティを持ちません。
解説
Amazon EMRは、60TBの大規模データ処理に最適化されたフルマネージドHadoop/Sparkプラットフォームです。コアノードにSpotインスタンスを使用することでオンデマンドと比べて最大90%のコスト削減が可能で、週次バッチ処理のようなフォールトトレラントなワークロードに適しています。
マスターノードをオンデマンドで安定性を確保しつつ、処理完了後にクラスターを自動終了(Transient Cluster)することでアイドル時間のコストをゼロにできます。60TBのカスタムPySparkロジックのような大規模処理において、EMR Spotは最もコスト効率の高いSparkプラットフォームです。
選択肢AのSageMaker Processing JobのSparkコンテナは中規模処理(数TBまで)に適していますが、60TBに対してインスタンス台数とコストが最適化しにくく、EMR Spotと比較してコスト効率が劣ります。
選択肢BのAWS Glue ETLはサーバーレスで運用負荷が低いですが、DPU課金はEMR Spotより高コストになりやすく、60TBの大規模処理ではコスト面で不利です。
選択肢DのSageMaker Data WranglerのカスタムPySpark変換は小〜中規模の変換向けGUIツールで、60TBの複雑なカスタムロジックには処理性能とスケーラビリティが不十分です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →