AIP生成AIアプリケーションの運用効率と最適化
メディア企業がAmazon Bedrock上でAIコンテンツ生成プラットフォームを運用しています。200名の編集者が同時に作業する平日9時〜18時に、安定して毎分300リクエストが発生します。現在はオンデマンドAPIを使用していますが、応答レイテンシが不安定で、スロットリングエラーが頻発しています。コストを許容範囲内に抑えながら、一貫したレイテンシを保証する最も適切な解決策はどれですか?
AAmazon Bedrock Provisioned Throughputを購入して必要なモデルユニット数を確保する
✓ 正解
Provisioned Throughputは指定モデルに専用のモデルユニットを確保し、スロットリングを防止して一貫した低レイテンシを実現する。毎分300件という予測可能な負荷パターンに最適で、長期コミットメントにより割引も適用されコストとレイテンシの両方を同時に改善できる。
BAWS Lambda関数の同時実行数の上限を引き上げ、リトライロジックにエクスポネンシャルバックオフを実装する
Lambda同時実行数の引き上げはBedrock側のスロットリング制限を解消しない。エクスポネンシャルバックオフはリトライ待機時間を増加させるため応答レイテンシをさらに悪化させ、200名の編集者が同時作業する環境では全体の作業効率を大きく損なう。
CAmazon SQSキューを介してリクエストをバッファリングし、レート制限内で順次処理する
SQSキューによるバッファリングはスループット制限内での処理を可能にするが、キュー待機による追加レイテンシが必ず発生する。リアルタイムで編集作業を行う200名のユーザーには応答時間の要件を満たせず、ユーザー体験を損なう。
D複数のAWSリージョンにBedrockエンドポイントを分散し、Amazon Route 53のレイテンシルーティングで負荷を分散する
マルチリージョン分散は設定・運用の複雑さを大幅に増加させ、リージョン間でのモデルバージョン管理も困難になる。各リージョンのオンデマンドスロットリング制限はそのまま残るため、スロットリングの根本的な解決策にはならない。
解説
Amazon Bedrock Provisioned Throughputは、指定したモデルに対して一定スループット(モデルユニット)を事前購入する機能です。
購入したモデルユニット数に応じたスループットが専用に確保されるため、スロットリングが発生せず、オンデマンドAPIと比較して一貫した低レイテンシが保証されます。
毎分300リクエストという予測可能で安定した負荷パターンに対してProvisioned Throughputは最も適しており、必要なモデルユニット数を計算して購入することでSLAを満たせます。1ヶ月または6ヶ月のコミットメントオプションがあり、長期コミットで割引が適用されます。
選択肢BのLambda同時実行数の引き上げとリトライは、根本的なスロットリング問題を解決しません。バックオフリトライはレイテンシをさらに悪化させ、編集者の作業効率を損ないます。
選択肢CのSQSキューによるバッファリングはスループット制限内での処理を可能にしますが、キューイングによる追加レイテンシが発生し、リアルタイム編集作業の要件を満たせません。
選択肢Dのマルチリージョン分散は設定・運用の複雑さが大幅に増加し、リージョン間のモデルバージョン管理も困難になります。スロットリングの根本解決にはなりません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →