無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

ある医療画像診断企業が、2TBのDICOM画像をAmazon S3に保存し、ml.p4d.24xlargeインスタンス8台を使った分散トレーニングで深層学習モデルを構築しています。CloudWatchメトリクスを確認すると、GPUの使用率が平均40%に留まっており、S3からのデータ読み込みがボトルネックと判明しました。GPU使用率を最大化し、トレーニング時間を短縮するために最も効果的な方法はどれか。

A
S3 Transfer AccelerationとマルチパートAPIにより読み込みスループットを改善し、SageMaker Training JobをFile Modeのままで実行する
S3 Transfer Accelerationは、AWSエッジロケーション経由でインターネット転送を高速化するサービスで、同一リージョン内のSageMakerインスタンスからのS3読み込みには効果がなく、GPUのデータ待ちボトルネックを解消できません。
B
Amazon FSx for Lustreファイルシステムを作成してS3バケットとデータリポジトリリンクを設定し、SageMaker Training JobにFSx for Lustreをマウントする
✓ 正解
FSx for Lustreは、S3データリポジトリリンクにより初回アクセス時に自動キャッシュを行い、GBps単位のスループットとサブミリ秒レイテンシーで複数GPUインスタンスへの並列データ供給を実現します。分散学習でのデータI/Oボトルネック解消に最適です。
C
SageMaker Training JobのデータチャネルをFile ModeからPipe Modeに切り替え、tf.dataパイプラインでストリーミング読み込みを実装する
Pipe Modeは、SageMaker独自のRecordIO形式でのストリーミングを前提としており、DICOM画像などの任意フォーマットへの対応が制限されます。また、マルチノードでの並列I/O性能においてFSx for Lustreに劣ります。
D
SageMaker Processing Jobで事前にS3からAmazon EFSにデータをコピーし、Training JobにEFSをNFSマウントして学習する
Amazon EFSはNFSベースの汎用分散ファイルシステムで、最大数Gbpsのスループットしか提供できないため、8台のp4d.24xlargeによる分散学習が要求する高帯域I/Oには対応できません。

解説

Amazon FSx for Lustreは、分散学習ワークロード向けに設計された高性能並列ファイルシステムで、GBps単位のスループットとサブミリ秒レイテンシーを提供します。S3データリポジトリリンク機能により、S3バケット内のファイルを自動的にキャッシュして複数のGPUインスタンスに高速配信できるため、データ読み込み待ちを解消しGPU使用率を大幅に向上させられます。 SageMaker Training JobはFSx for LustreをNFSマウントとして参照でき、追加コーディングなしに既存の学習スクリプトをそのまま活用できます。 選択肢AのS3 Transfer Accelerationは、インターネット経由の遠距離転送を高速化するもので、同一リージョン内のSageMakerインスタンスからのS3アクセス改善には効果がありません。 選択肢CのPipe Modeは、RecordIO形式でのストリーミング読み込みに対応しますが、DICOM等の任意フォーマットのサポートが限定的で、複数ノードへの高速並列I/Oには不向きです。 選択肢DのAmazon EFSは汎用分散ファイルシステムですが、FSx for Lustreと比較してスループットが劣り(数Gbps以下)、大規模GPUクラスターの高速データ供給には不十分です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る