AIP生成AIアプリケーションの運用効率と最適化
ある企業がAmazon Bedrockを使用した顧客サポートチャットボットを構築しています。製品チームから「ユーザーが送信ボタンを押してから1秒以内に応答テキストが画面に表示され始めること」という体験要件が出されました。使用するモデルの平均応答長は800トークンで、全トークン生成完了まで平均8秒かかります。この要件を最小の実装コストで達成するAPIはどれですか?
AInvokeModel APIを使用し、全800トークンの生成完了後にJSONレスポンスとしてまとめて返す
InvokeModel APIは全800トークンの生成完了後にJSONレスポンスとしてまとめて返すため、8秒の遅延が発生して要件を満たせません。
BInvokeModelWithResponseStream APIを使用し、生成されたトークンをチャンク単位でリアルタイムにクライアントへストリーミングする
✓ 正解
InvokeModelWithResponseStream APIはAmazon EventStream(AWSのバイナリストリーミングプロトコル)でトークンを逐次送信します。8秒かかる全生成を待たずに最初のトークンが数百ミリ秒で届き、1秒以内表示要件を満たします。
CStartAsyncInvoke APIでリクエストを投入し、GetAsyncInvokeでポーリングして完了後にS3から結果を取得する
StartAsyncInvoke APIはポーリング方式で即時表示に不向きです。
DConverse APIを使用してメッセージ形式でリクエストを送信し、完了後に全レスポンスを一括取得する
Converse APIは全生成完了後に返答するため遅延が大きく、要件を満たせません。
解説
InvokeModelWithResponseStream APIはAmazon EventStream(AWSのバイナリストリーミングプロトコル)でトークンを逐次送信します。8秒かかる全生成を待たずに最初のトークンが数百ミリ秒で届き、1秒以内表示要件を満たします。
選択肢AのInvokeModel APIは全800トークンの生成完了後にJSONレスポンスとしてまとめて返すため、8秒の遅延が発生して要件を満たせません。
選択肢CのStartAsyncInvoke APIはポーリング方式で即時表示に不向きです。
選択肢DのConverse APIは全生成完了後に返答するため遅延が大きく、要件を満たせません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →