AIF基盤モデルのアプリケーション
ある企業が、毎晩蓄積される数十万件の問い合わせログを、Amazon Bedrockの基盤モデルでまとめて分類・要約する処理を計画しています。即時のリアルタイム応答は不要で、推論にかかるコストをできるだけ最小化したいと考えています。最も適切な実行方法はどれですか。
A1件ずつ即時に応答を返すオンデマンドのリアルタイム推論を多数同時に実行する
即時応答向けで単価が高い方式を多数実行するとコストがかさみ、リアルタイム性が不要な大量バッチ処理のコスト最小化という要件に合致しない。
B安定したスループットを確保するためにプロビジョンドスループットを予約購入する
一定キャパシティを予約する方式で継続的な高負荷には向くが、夜間に限定されたバッチ処理では予約分が無駄になりやすくコスト最小化に最適とはいえない。
Cモデルの重みを更新して分類精度を高めるファインチューニングを実施する
モデルの重みを更新して精度を高める手法であり、推論コストを最小化する目的とは異なるため要件に合致しない。
D大量データを非同期でまとめて処理し料金を抑えるバッチ推論(Batch inference)を利用する
✓ 正解
大量データを非同期でまとめて処理する方式で、オンデマンド推論より低料金で実行でき、即時応答不要で夜間にまとめて処理しコストを抑えたい要件に最適。
解説
Amazon Bedrockのバッチ推論(Batch inference)は、大量の入力データをまとめて非同期で処理する方式で、オンデマンドのリアルタイム推論よりも低い料金で実行できます。
即時応答が不要で、夜間にまとめて大量データを処理しコストを最小化したいという要件に最適です。
選択肢のオンデマンドのリアルタイム推論は即時応答向けで単価が高く、バッチ用途のコスト最小化には適さない。
選択肢のプロビジョンドスループットは一定キャパシティを予約する方式で、継続的な高負荷には向くが、夜間限定のバッチ処理では予約コストが無駄になりやすい。
選択肢のファインチューニングはモデル精度を高める手法で、推論コストの最小化を直接の目的とはしない。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →