MLA機械学習のためのデータ準備
深層学習チームは Amazon S3 に格納された 5TB の画像データセットで ResNet モデルをトレーニングしています。
各ジョブは同一データを 100 エポック読み込むため S3 への API コールが急増し、スロットリングエラーによりトレーニング時間が 40% 増加しています。
この問題を解消しデータ読み取りスループットを最大化するために最も適切なアーキテクチャはどれですか。
AAmazon S3 Transfer Acceleration を有効化し、マルチパートアップロードとプリフェッチを設定してスロットリングを軽減する
S3 Transfer Acceleration はリージョン間転送を AWS エッジロケーション経由で高速化するサービスであり、同一リージョン内の API スロットリング問題には対応していない。エポック繰り返しによる API コール急増の根本解決にはならない。
BAmazon FSx for Lustre ファイルシステムを S3 バケットにリンクして作成し、SageMaker トレーニングジョブのデータソースとして設定する
✓ 正解
FSx for Lustre は S3 バケットをリンクしてデータをキャッシュするため、2 回目以降のエポックでは S3 API コールが発生しない。数百 GB/s の高性能並列ファイルシステムとして SageMaker トレーニングジョブのデータソースに直接指定でき、スロットリングを根本的に解消できる。
CAmazon EFS にトレーニングデータをコピーし、複数の SageMaker トレーニングインスタンスから NFS マウントで並列読み取りを行う
Amazon EFS は共有ファイルシステムとして複数インスタンスからのアクセスに対応するが、スループットは FSx for Lustre の数十分の一程度であり、大規模深層学習の高スループット要件を満たさない。
DSageMaker トレーニングジョブの入力モードを File Mode から Pipe Mode に切り替え、S3 から直接ストリーミング読み込みを行う
Pipe Mode は S3 からストリーミングしてディスク使用量を抑えるモードだが、同一データを複数エポック繰り返す場合は毎エポック S3 から読み込むため API コールが増加し、スロットリング問題が悪化する可能性がある。
解説
Amazon FSx for Lustre は S3 と統合された高性能並列ファイルシステムで、S3 バケットをリンクするとデータが自動的にインポートされ、以降の読み取りはすべてローカルファイルシステムとして処理される。同一データを複数エポック読む場合は S3 API コールが一切発生せず、スロットリングを根本的に解消できる。数百 GB/s のスループットを提供し、SageMaker トレーニングジョブのデータソースとして直接指定可能。
選択肢Aの Amazon S3 Transfer Acceleration はリージョン間転送の高速化サービスであり、同一リージョン内の S3 API スロットリング問題を解消する機能はない。
選択肢Cの Amazon EFS は汎用共有ファイルシステムで複数インスタンスからの同時アクセスに対応するが、FSx for Lustre と比較してスループットが低く、大規模深層学習トレーニングには性能が不足する。
選択肢Dの Pipe Mode は S3 からのストリーミング読み込みでローカルディスクを節約できるが、同一データを複数エポック読む場合は毎回 S3 API コールが発生するためスロットリングが継続し、問題の根本解決にならない。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →