グローバルな旅行予約サービスが Amazon Bedrock を使用したカスタマーサポートチャットボットを本番運用しています。データサイエンスチームは Chain-of-Thought プロンプト戦略への変更により応答品質が向上すると予測していますが、既存ユーザーへの影響を最小化しながら本番トラフィックの10%のみで新プロンプトを段階的に検証し、定量的データに基づいた採用判断をしたいと考えています。最も適切なアーキテクチャはどれですか?
Bedrock Prompt Management はプロンプトのバージョン管理と公開を管理する機能で、Lambda での動的ルーティングと組み合わせることで低リスクなカナリアリリースが実現できます。リクエストの10%のみを新プロンプトで処理しつつ、CloudWatch カスタムメトリクスで品質スコア(解決率・顧客満足度等)を継続計測することで、統計的に有意なデータドリブンな採用判断が可能になります。 選択肢BのSageMaker Experiments は ML モデルのトレーニング実験管理ツールであり、Bedrock のプロンプトA/Bテストには設計されていない。シャドウイング評価はオフライン環境のみで、本番ユーザーの実際の反応を計測できない。 選択肢Cの手動テスト100件は統計的有意性が低く、QA チームの主観評価に依存するため定量的判断の根拠として不十分。本番トラフィックの10%のみに絞る要件も満たせていない。 選択肢DのStep Functions + DynamoDB によるスティッキーセッションはユーザー体験の一貫性には寄与するが、10%への段階的適用と CloudWatch による定量的品質計測という本問の要件を含んでいない。