無限ノック › MLA 練習問題一覧 › 問題
MLAMLモデルの開発

MLエンジニアがAmazon S3に保存した400GBのCSVファイルをSageMaker Training Jobsで訓練しています。現在はFile modeを使用しており、ジョブ起動のたびにS3からインスタンスのローカルストレージへ全データをコピーするのに25分かかり、反復実験のターンアラウンドが問題になっています。ローカルへの事前コピーを排除してトレーニング起動時間を短縮する方法として最も効果的なものはどれですか。

A
S3 Transfer Acceleration を有効化してS3からトレーニングインスタンスへのデータ転送速度を改善する
S3 Transfer AccelerationはCloudFrontのエッジロケーションを経由してS3との転送速度を向上させる機能。転送が高速になるがFile modeのローカルへの全データコピー処理自体はなくならないため、毎回25分かかる事前コピーの根本解決にはならない。
B
Amazon EFS にデータを移行しNFSマウントで複数のトレーニングジョブ間でデータを共有する
Amazon EFSはNFSプロトコルで複数インスタンスからのファイル共有が可能なマネージドファイルシステムで、一度データを配置すれば複数ジョブで再利用できる。ただし初期データ移行にS3からのコピーが必要であり、事前コピーを根本的に排除するという要件の直接的な解決にはならない。
C
SageMaker の Pipe mode に変更しS3からデータをストリーミングしてローカルへの事前コピーを排除する
✓ 正解
SageMaker Pipe modeはS3からトレーニングコンテナへデータを名前付きパイプ(FIFO)でストリーミングする入力モードで、ローカルストレージへの事前コピーが不要。トレーニング起動直後から学習を開始でき25分の待機時間を排除して反復実験を効率化できる正しい選択。
D
Amazon FSx for Lustre をS3データリポジトリに連携してトレーニングインスタンスに高スループットで提供する
Amazon FSx for LustreはS3データリポジトリと連携可能な高スループット並列ファイルシステム。ただしS3のデータはFSxファイルシステムに遅延ロードまたはインポートされる必要があり、Pipe modeのようにS3から直接ストリーミングして即座に訓練を開始する仕組みとは性質が異なる。

解説

SageMaker Pipe modeは、S3のデータをトレーニングコンテナに名前付きパイプ(FIFO)としてストリーミング配信する入力モードです。File modeのように事前に全データをローカルにコピーする工程を省き、トレーニング開始と同時にデータが逐次供給されます。 これにより: ①ジョブ起動直後から学習を開始でき25分の事前コピー待ちが不要になる ②インスタンスのローカルストレージ容量に依存しない大規模データセットへの対応が可能 ③反復実験のターンアラウンドを大幅に短縮できる 選択肢AのS3 Transfer Accelerationは転送速度を向上させるがFile modeのコピー処理自体は残るため事前コピー時間の根本排除にはならない。 選択肢DのAmazon FSx for Lustreは高スループットだがS3リポジトリ連携では初回アクセス時のデータ取り込みが発生しPipe modeのような真のストリーミングとは異なる。 選択肢BのAmazon EFSは複数ジョブ間でのデータ共有に有効だが初回セットアップにS3からのデータ移行が必要で事前コピー排除の要件を満たさない。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る