無限ノック › MLA 練習問題一覧 › 問題
MLAMLソリューションの監視、メンテナンス、セキュリティ

機械学習チームが本番稼働中の商品レコメンデーションモデル(現行バージョン)の後継となる新モデルを開発しました。新モデルをリリースする前に実際の本番トラフィックに対する推論品質を検証したいが、ユーザーが受け取るレスポンスへの影響は一切許容されません。この制約を厳守しながら本番リクエストで新モデルの性能を評価するには、どのアプローチが最も適切ですか?

A
SageMaker Pipelinesの評価ステップでホールドアウトテストデータセットに対して新モデルのAUCなどを算出し、閾値を上回った場合のみ本番エンドポイントの更新を自動承認する
Pipelinesの評価ステップによるホールドアウトテストはオフライン評価として有用だが、本番トラフィックの実際のリクエスト分布(時間帯・ユーザー層の偏り等)を完全には再現できず、本番環境での性能確認手段として不完全。
B
SageMaker エンドポイントに2つのプロダクションバリアントを追加してトラフィックを95:5で分割し、少量の本番リクエストで新モデルの品質を段階的に検証するカナリアリリースを実施する
カナリアリリースは段階的な本番投入に有効な手法だが、5%のユーザーは新モデルの応答を受け取るため「ユーザーへの影響を一切許容しない」という要件に明確に違反する。
C
SageMaker Shadow Testing を有効化して本番リクエストのコピーを新モデルバリアントにも転送し、ユーザーには現行モデルの応答のみを返しながら両モデルの推論結果を比較・評価する
✓ 正解
Shadow Testingはリクエストコピーをシャドウバリアントに転送しユーザーには現行モデルの応答のみを返す。「影響ゼロ」かつ「本番データでの評価」を同時に実現できる唯一のアプローチ。CloudWatchで両バリアントのメトリクスを比較できる。
D
SageMaker Batch Transform ジョブで直近1ヶ月分の本番推論ログを新モデルで再推論し、現行モデルの推論結果と照合してオフラインで性能を比較評価する
過去の本番推論ログをBatch Transformで再推論するオフライン評価では、静的なデータセットを使うため最新のリクエストパターンやリアルタイムの特性変化(概念ドリフト等)を評価できず、本番環境での実際の性能を正確に反映できない。

解説

SageMaker Shadow Testing は、本番エンドポイントへの実際のリクエストのコピーをシャドウバリアント(新モデル)に転送し、ユーザーには現行モデルの応答のみを返す機能。シャドウバリアントの推論結果はCloudWatchメトリクスとしてログに記録され、レイテンシー・精度・エラー率などの観点で現行モデルと比較できる。ユーザーへの影響がゼロでありながら本番の実際のリクエスト分布でモデルを評価できるため、「ユーザーへの影響を一切許容しない」という制約に完全に合致する。 選択肢AのPipelinesによるホールドアウトテストはオフライン評価であり、本番の実際のリクエスト分布との乖離が生じる可能性がある。 選択肢Bのカナリアリリース(95:5)は5%のユーザーが新モデルの応答を受け取るため「ユーザーへの影響ゼロ」という制約に違反する。 選択肢DのBatch Transformを使った過去ログの再推論はオフライン評価であり、リアルタイムの本番トラフィック特性を完全には再現できない。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る