グローバルなeコマースプラットフォームがAmazon Bedrockをus-east-1リージョンで稼働させています。ブラックフライデーなどの大規模セール期間中、Provisioned Throughputを購入しているにもかかわらず追加のThrottlingExceptionが発生し、レイテンシSLAを満たせない状況が生じています。インフラ管理の複雑さを最小限に抑えながら、自動的に追加キャパシティを確保する最適なアプローチはどれですか?
BedrockのクロスリージョンAmazon推論プロファイル(system-defined inference profile)は、プライマリリージョンがキャパシティ上限に達した際に自動的に他リージョン(例:us-east-1→us-west-2→eu-west-1)へリクエストをルーティングします。アプリケーション側の変更はモデルIDをプロファイルARNに変更するだけです。 選択肢A(Route 53のレイテンシベースルーティング)は手動でトラフィックを分散する必要があり、自動的なキャパシティルーティングには対応していません。 選択肢C(SQSキューでバッファリング)はレイテンシSLAに違反します。 選択肢D(Provisioned Throughputの過剰調達)はコスト非効率です。