無限ノック › AIP 練習問題一覧 › 問題
AIPテスト、検証、トラブルシューティング

グローバルな旅行予約サービスが Amazon Bedrock を使用したカスタマーサポートチャットボットを本番運用しています。データサイエンスチームは Chain-of-Thought プロンプト戦略への変更により応答品質が向上すると予測していますが、既存ユーザーへの影響を最小化しながら本番トラフィックの10%のみで新プロンプトを段階的に検証し、定量的データに基づいた採用判断をしたいと考えています。最も適切なアーキテクチャはどれですか?

A
AWS Lambda 関数内で受信リクエストの10%をランダムに新しい Chain-of-Thought プロンプトへルーティングし、Bedrock Prompt Management でバージョン管理。両バージョンの品質スコアを CloudWatch カスタムメトリクスで継続的に計測して統計的に比較する
✓ 正解
Lambda でのランダムルーティング(10%)と Bedrock Prompt Management のバージョン管理を組み合わせることで低リスクなカナリアリリースが実現できる。CloudWatch カスタムメトリクスによる継続的な品質計測で統計的に有意な比較が可能であり、すべての要件を満たす。
B
Amazon SageMaker Experiments に2つの Bedrock プロンプトをバリアントとして登録し、本番トラフィックをシャドウイングで複製して新プロンプトをオフライン環境で評価することで、本番ユーザーへのリスクをゼロにする
SageMaker Experiments は ML モデルのトレーニング実験を管理するサービスであり、Bedrock プロンプトのA/Bテストには直接対応していない。シャドウイング評価はオフライン環境の検証にとどまり、本番ユーザーの実際の反応(品質スコア)を計測できない。
C
API Gateway ステージ変数で本番(v1)とテスト(v2)の2エンドポイントを分離し、QA チームが各エンドポイントに対して100件のリクエストを手動実行してレスポンス品質をスプレッドシートで記録・比較する
API Gateway ステージによる分離と手動テスト100件では統計的有意性が得られず、本番トラフィックの10%のみを対象とする要件も満たせない。QA チームの主観的評価は定量的な品質比較として信頼性に欠ける。
D
AWS Step Functions の Choice 状態でA/Bルーティングロジックを実装し、DynamoDB にユーザーごとのプロンプトバリアント割り当てを保存してセッションをまたいで同じプロンプトをユーザーに提供する
Step Functions + DynamoDB によるスティッキーセッション実装はユーザー体験の一貫性に寄与するが、10%への段階的トラフィック制御と CloudWatch による定量的品質計測の仕組みを持たず、本問のA/Bテスト要件を十分に果たせない。

解説

Bedrock Prompt Management はプロンプトのバージョン管理と公開を管理する機能で、Lambda での動的ルーティングと組み合わせることで低リスクなカナリアリリースが実現できます。リクエストの10%のみを新プロンプトで処理しつつ、CloudWatch カスタムメトリクスで品質スコア(解決率・顧客満足度等)を継続計測することで、統計的に有意なデータドリブンな採用判断が可能になります。 選択肢BのSageMaker Experiments は ML モデルのトレーニング実験管理ツールであり、Bedrock のプロンプトA/Bテストには設計されていない。シャドウイング評価はオフライン環境のみで、本番ユーザーの実際の反応を計測できない。 選択肢Cの手動テスト100件は統計的有意性が低く、QA チームの主観評価に依存するため定量的判断の根拠として不十分。本番トラフィックの10%のみに絞る要件も満たせていない。 選択肢DのStep Functions + DynamoDB によるスティッキーセッションはユーザー体験の一貫性には寄与するが、10%への段階的適用と CloudWatch による定量的品質計測という本問の要件を含んでいない。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る