SAA高性能なアーキテクチャの設計
ある機械学習企業が、GPU 搭載の Amazon EC2 クラスタ(数十ノード)で大規模モデルのトレーニングを行っています。トレーニングデータ数百TBは Amazon S3 に保存されており、学習ジョブ実行時には全ノードからサブミリ秒レイテンシ・数百GB/s 級のスループットで並列読み取りが必要です。ジョブは断続的に実行され、完了後は結果を S3 に書き戻します。最も高いパフォーマンスを得られる構成はどれですか。
AAmazon FSx for Lustre を S3 バケットにリンクし、GPU クラスタから高スループット・低レイテンシで読み取る
✓ 正解
FSx for Lustre は HPC・ML 向けの並列ファイルシステムで、サブミリ秒レイテンシと数百GB/s 級スループットを提供し、S3 リンクでデータの読み込みと書き戻しが可能なため、断続ジョブを含め全要件を満たします。
BAmazon EFS(Elastic スループット)にデータをコピーし、複数の GPU インスタンスから同時にマウントして読み取る
EFS は汎用の共有ファイルシステムで、Elastic スループットでも Lustre 級の集約スループットや低レイテンシは得られません。数百TB・数百GB/s の ML トレーニング性能要件を満たせません。
Cio2 Block Express の EBS ボリュームを EBS マルチアタッチで複数の GPU インスタンスに接続して共有する
EBS マルチアタッチは io2 ボリュームを同一AZ内の少数インスタンスで共有する機能で、数十ノードのクラスタ全体での共有や S3 との連携に対応せず、本構成には適しません。
DS3 バケットを Mountpoint for Amazon S3 で各 GPU インスタンスにマウントし、直接読み取る
Mountpoint for Amazon S3 は S3 をファイルとして扱えますが、並列ファイルシステムではなく、Lustre のような低レイテンシ・超高スループットの並列読み取り性能には届きません。
解説
FSx for Lustre は HPC・機械学習向けに設計された高性能並列ファイルシステムで、サブミリ秒のレイテンシと数百GB/s 級のスループットを提供します。S3 とのデータリポジトリ連携により、S3 のデータを透過的に読み込み、結果を S3 へ書き戻せます。断続的なジョブにも適し、要件を満たします。
選択肢Bの EFS は汎用共有ファイルシステムで、Lustre ほどの集約スループットや低レイテンシは出せず、大規模 ML トレーニングの性能要件には届きません。
選択肢Cの EBS マルチアタッチは io2 ボリュームを少数の同一AZインスタンスで共有する用途で、数十ノードのクラスタ共有や S3 連携には対応しません。
選択肢Dの Mountpoint for Amazon S3 は S3 へのファイル的アクセスを可能にしますが、Lustre のような並列ファイルシステムの低レイテンシ・高スループットには及びません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでSAAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →