法律事務所が契約書レビュー用の生成AIアプリケーションをAmazon BedrockとAPI Gatewayで構築しています。ユーザーから「回答が画面に表示されるまで25〜35秒かかる」という苦情が多発しています。契約書の性質上、生成するトークン数の削減や小型モデルへの切り替えは品質上許容されません。アプリケーションコードの変更を最小限に抑えながら、ユーザーが最初のテキストを見るまでの時間(TTFT:Time To First Token)を最も効果的に短縮する方法はどれですか?
InvokeModelWithResponseStream はトークンが生成されるたびにイベントストリームとしてクライアントへ送信するため、全生成完了を待たずに最初のトークンを即時表示できます。これによりTTFT(Time To First Token)が数百ミリ秒レベルまで短縮され、ユーザーの知覚レイテンシが劇的に改善されます。 選択肢Aは不正解です。CloudFrontキャッシュは同一クエリにしか効果がなく、契約書レビューのような多様なクエリではキャッシュヒット率が極めて低いため有効ではありません。 選択肢Cは不正解です。Lambdaのメモリ増加はCPU比例で処理速度を向上させますが、LLMの推論速度そのものには影響しません。複数チャンクの並列生成という概念も生成AIの動作原理上実現できません。 選択肢Dは不正解です。Provisioned ThroughputはスループットキャパシティであってTTFT改善には直接効果がありません。スロットリング解消には有効ですが、応答時間の体感改善にはなりません。