無限ノック › MLA 練習問題一覧 › 問題
MLAMLワークフローのデプロイとオーケストレーション

ECコマース企業のデータサイエンスチームが、SageMaker Batch Transformを使用してS3上の数百万件の顧客トランザクションデータに対して購買予測スコアを生成しています。入力CSVには「顧客ID・購買履歴・属性情報」が含まれていますが、Batch Transformの出力ファイルには予測スコアのみが含まれるため、後続処理で顧客IDと予測スコアを突き合わせる追加の後処理ジョブが必要になっています。この後処理ステップを排除し、出力ファイルに顧客IDと予測スコアを直接含める最も効率的な方法はどれですか?

A
Batch Transform完了後にAWS Glue ETLジョブを自動実行し、S3上の入力ファイルと推論出力ファイルを顧客IDをキーに結合して最終的な結果ファイルを生成する
「Glue ETLジョブ」は、後処理による追加のコスト・実行時間・パイプライン管理が発生し、Batch Transformの組み込み機能を活用しない非効率なアプローチです。
B
Batch Transformの設定でJoinSourceを"Input"に設定し、InputFilterで推論に必要なカラムのみをモデルに渡し、OutputFilterで顧客IDと予測スコアを含む必要なカラムのみを出力ファイルに含める
✓ 正解
SageMaker Batch Transformには、入力データと推論結果を結合するデータ加工機能が組み込まれています。JoinSourceを"Input"に設定すると、各レコードの入力データが対応する推論結果に結合されます。InputFilterで推論に必要なカラムのみをモデルに送り(顧客IDを除外してモデルの精度を保つ)、OutputFilterで最終出力に含めるカラム(顧客IDと予測スコア)を絞り込めます。これにより後処理ジョブ不要で、目的の出力ファイルを直接生成できます。
C
推論コンテナのpredict()関数内で入力レコードをそのまま推論結果に付加して返すようコンテナのコードを改修し、イメージを再ビルドしてECRへ再プッシュしてモデルを再登録する
「推論コンテナの修正」は、コンテナの再ビルド・テスト・ECRへのプッシュが必要で運用コストが高く、Batch Transformの標準機能で解決できる問題には不適切です。
D
SageMaker Pipelinesに後続のSageMaker Processingステップを追加し、入力CSVと推論出力CSVをPandasで顧客IDをキーに結合して出力する処理を実装する
「SageMaker Processingステップ」は、後処理の別実装であり、追加のコストと実行時間が発生します。Batch Transformの組み込み機能で解決できる問題に対して不必要に複雑な構成になります。

解説

SageMaker Batch Transformには、入力データと推論結果を結合するデータ加工機能が組み込まれています。JoinSourceを"Input"に設定すると、各レコードの入力データが対応する推論結果に結合されます。InputFilterで推論に必要なカラムのみをモデルに送り(顧客IDを除外してモデルの精度を保つ)、OutputFilterで最終出力に含めるカラム(顧客IDと予測スコア)を絞り込めます。これにより後処理ジョブ不要で、目的の出力ファイルを直接生成できます。 選択肢Aの「Glue ETLジョブ」は、後処理による追加のコスト・実行時間・パイプライン管理が発生し、Batch Transformの組み込み機能を活用しない非効率なアプローチです。 選択肢Cの「推論コンテナの修正」は、コンテナの再ビルド・テスト・ECRへのプッシュが必要で運用コストが高く、Batch Transformの標準機能で解決できる問題には不適切です。 選択肢Dの「SageMaker Processingステップ」は、後処理の別実装であり、追加のコストと実行時間が発生します。Batch Transformの組み込み機能で解決できる問題に対して不必要に複雑な構成になります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る