ある法律リサーチ企業が判例検索AIエージェントをAmazon Bedrock Agentsで構築しています。デフォルトのReAct(推論と行動を交互に繰り返すオーケストレーション戦略)では、単純な判例検索クエリでも3〜5回のFM推論ステップが発生しレイテンシが高い問題があります。95パーセンタイルのレスポンスタイムを3秒以内に抑えることが必須要件です。 エージェントアーキテクチャを維持しながら最も効果的にレイテンシを削減する方法はどれですか?
Amazon Bedrock Agentsのカスタムオーケストレーション(Custom Orchestration)では、デフォルトのReActループをLambda関数で実装した独自ロジックに置き換えられます。クエリ複雑さの事前分類により、単純な検索は1ステップ直接処理・複雑なクエリのみ多段推論を適用するハイブリッド戦略を実現できます。 選択肢AのHaikuへの変更は1ステップの推論時間は短縮できますが、ReActループのステップ数自体は変わらないため、エンドツーエンドのレイテンシ改善効果は限定的です。 選択肢CのProvisioned Throughputはスループット(同時処理数)向上に有効ですが、単一リクエストのエンドツーエンドレイテンシそのものへの改善効果は限定的です。 選択肢DのElastiCacheキャッシュ戦略は同一クエリの再利用に限定され、判例検索のように多様なクエリが多い環境ではキャッシュヒット率が低く、95パーセンタイルのレイテンシ改善効果が薄い上にElastiCacheクラスターの運用負担も生じます。