ある金融サービス企業がAmazon Bedrockを使用してClaudeモデルで融資審査ドキュメントをリアルタイム分析するシステムを構築しています。本番環境では平日業務時間中に毎分600リクエストの定常的なトラフィックが見込まれます。テスト環境でオンデマンド推論を使用したところ、ThrottlingExceptionが頻発しSLAである3秒以内の応答時間を達成できませんでした。この問題を解決し要件を満たす最も適切な解決策はどれですか?
Provisioned ThroughputはModelUnits単位でスループット容量を事前に確保し、ThrottlingExceptionが発生しない安定したスループットを保証します。毎分600リクエストという予測可能な定常高負荷ワークロードに最適であり、SLAである3秒以内の応答時間を確実に達成できます。 選択肢Aは、指数バックオフとジッターによる自動リトライを実装する方法ですが、スロットリングが頻発する状況でリトライを繰り返すとレイテンシがさらに増大してSLAをさらに悪化させます。スループット不足の根本原因は解決されません。 選択肢Bが正解です。必要なModelUnitsを計算してProvisioned Throughputを購入することでスループット容量を事前確保でき、ThrottlingExceptionなしに定常的な高負荷トラフィックに対応してSLA要件を満たせます。 選択肢Cは、Amazon SQSキューでリクエストをバッファリングしLambdaが一定レートでBedrockを呼び出す方法ですが、キューイングによる遅延が発生するためリアルタイム処理のSLA(3秒以内)を達成できません。 選択肢Dは、Amazon Bedrock Batch Inferenceを使用する方法ですが、Batch Inferenceは大量データを非同期で処理するサービスであり、リアルタイムの応答が求められる融資審査システムには根本的に不適切です。