MLA機械学習のためのデータ準備
ある企業が、複数のGPUインスタンスを使った分散トレーニングで、Amazon S3に保存された5TBの画像データセットを学習しています。トレーニング中にGPU使用率が低く、各エポックでデータの読み込みがボトルネックになっていることが判明しました。アプリケーションコードの変更を最小限に抑えつつ、全インスタンスから学習データへの高スループットな並列アクセスを実現したいと考えています。最も適した方法はどれですか。
AAmazon FSx for Lustre を S3 バケットにリンクし、トレーニングジョブの入力として高スループットの並列ファイルシステムを提供する
✓ 正解
S3 にリンクされた FSx for Lustre は数百GB/秒の並列スループットと低レイテンシーを提供し、複数インスタンスからの同時読み込みを高速化するため、データ読み込みのボトルネックを解消できる。SageMaker のデータ入力としてネイティブ対応し、コード変更も最小限で済む。
BAmazon EFS をプロビジョニングして全インスタンスにマウントし、汎用パフォーマンスモードで共有アクセスする
EFS は複数インスタンスからの共有マウントには対応するが、汎用モードでは大規模分散ML学習が要求する高並列スループットを満たせず、I/Oボトルネックが残るため最適ではない。
C各トレーニングインスタンスにアタッチした EBS gp3 ボリュームへ事前に全データをコピーしてから学習を開始する
EBS への事前コピーは起動のたびに5TBの転送時間が発生し、ボリュームが各インスタンスに独立するためコストも増大する。並列ファイルアクセスの要件を満たさず非効率である。
DS3 から SageMaker の File モードでエポックごとに全データをローカルディスクへダウンロードして展開する
File モードでのエポックごとの全データダウンロードは、学習開始前後に大きな待機時間を生み、読み込みボトルネックをむしろ悪化させる。高スループットの並列アクセスという要件に反する。
解説
Amazon FSx for Lustre は、HPCや機械学習向けに設計された高性能並列ファイルシステムで、S3バケットとシームレスに連携できます。S3のデータをオンデマンドで遅延ロードしながら、数百GB/秒規模のスループットと低レイテンシーで複数インスタンスから並列アクセスでき、分散トレーニングのデータ読み込みボトルネックを解消します。SageMaker のデータ入力としてネイティブにサポートされ、コード変更も最小限です。
選択肢Bの Amazon EFS は共有アクセス可能ですが、Lustre ほどの並列スループットがなく大規模ML学習のI/O要求には不十分です。
選択肢Cの EBS への全コピーは、起動のたびに5TBの転送時間とストレージコストが発生し非効率です。
選択肢Dの File モードでの都度ダウンロードは、エポックごとにダウンロード待ちが生じ、ボトルネックをさらに悪化させます。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →