MLAMLワークフローのデプロイとオーケストレーション

本番でモデルv1を提供しているMLチームは、新モデルv2を本番リリース前に評価したいと考えています。実際の本番リクエストをv2にも複製して送り、v2のレイテンシーやエラー率を検証したい一方、ユーザーへ返す応答は引き続きv1のものだけにし、v2の結果がユーザーに影響しないようにしたいです。最も適した方法はどれですか。

A
本番バリアントの重みを調整し、トラフィックの10%をv2に振り分けるカナリアデプロイを行う
カナリアデプロイはトラフィックの一部を実際にv2へ振り分けてユーザーに応答を返すため、v2の結果がユーザーへ影響する。ユーザー影響なしに検証したい本要件を満たさない。
B
SageMaker のシャドウバリアント(シャドウテスト)を構成し、本番トラフィックを複製してv2に送る
✓ 正解
シャドウテストは本番リクエストをシャドウバリアントへ複製送信し、v2のレイテンシーやエラー率を記録する。応答はユーザーに返されず本番v1のみが提供されるため、影響なしで実トラフィック評価ができる。
C
v1とv2を50:50で振り分けるA/Bテストを構成し、両モデルの指標を比較する
A/Bテストは両モデルの応答を実際にユーザーへ返して比較する手法で、v2の出力がユーザーに届いてしまう。ユーザーへ影響を与えずに検証するという本要件に反する。
D
本番リクエストのログをS3に蓄積し、v2でバッチ変換を実行して指標を後から比較する
ログを使ったバッチ変換は過去データでのオフライン評価であり、本番のリアルタイムなレイテンシーやエラー率を実トラフィックで測定できないため、リアルタイム挙動の検証要件に合わない。

解説

SageMakerのシャドウテストは、本番リクエストをシャドウバリアントへ複製して送信し、v2のレイテンシーやエラー率を記録する。シャドウの応答はユーザーに返されず本番v1のみが提供されるため、ユーザーへ影響を与えずに実トラフィックでv2を評価できる。 選択肢Aのカナリアと選択肢CのA/Bテストはv2の応答を実際にユーザーへ返すため影響が生じる。 選択肢Dのバッチ変換は過去データのオフライン評価でリアルタイム挙動を測定できない。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る