Eコマース企業がAmazon Bedrockでカスタムモデルをファインチューニングし、商品推薦チャットボットとして本番稼働させる計画です。このアプリケーションには以下の要件があります。 - 1秒あたり平均150リクエストの処理 - p99レイテンシ500ms以下という厳格なSLA カスタムモデルで本番運用するために最も適切なデプロイ戦略はどれか。
Amazon BedrockのカスタムモデルはProvisioned Throughputの使用が必須であり、オンデマンド推論では利用できません。 選択肢AはExponential Backoffによるリトライロジックを実装しようとしていますが、カスタムモデルはオンデマンド推論自体が利用できないため根本的に動作しません。 選択肢BはProvisioned ThroughputでMU(Model Unit)を割り当ててカスタムモデル専用のコンピューティングリソースを確保し、安定した低レイテンシとスループット保証を提供します。カスタムモデルには必須の方式であり、高トラフィックとSLA要件を満たす最適な選択です。 選択肢CのSageMakerへのエクスポートはBedrockの現行機能では直接サポートされていません。 選択肢DのElastiCacheによるキャッシュはキャッシュヒット時のみ有効な確率的な最適化に過ぎず、すべてのリクエストに対するSLA保証には不十分です。