医療分析企業が毎日 800,000 件の患者診療記録から臨床サマリーノートを生成する必要があります。処理は 12 時間以内(夜間バッチウィンドウ)に完了すれば十分であり、リアルタイム応答は不要です。現在は Lambda 関数プールで InvokeModel API を同期呼び出ししており、ThrottlingException が頻発しコストも高騰しています。コストを削減しスロットリングを解消する方法として最もコスト効率が高いものはどれですか?
Amazon Bedrock Batch Inference は、大量のリクエストを S3 上の JSONL 形式でまとめて送信し、Bedrock が非同期で処理して結果を S3 に書き込む機能です。オンデマンド料金と比較して最大 50% のコスト削減が可能で、スロットリングは Bedrock 側で内部管理されるため ThrottlingException が発生しません。12 時間以内に完了すれば十分というバッチウィンドウの要件にも最適で、既存の同期アーキテクチャを大幅に簡素化できます。 選択肢Aの Lambda 並列数拡大はオンデマンド料金のまま変わらずコスト削減にならず、API レート上限に対するスロットリングも引き続き発生します。 選択肢Bの Provisioned Throughput は 800,000 件/日の大量処理に必要な大規模キャパシティを継続的に予約するコストが高く、Batch Inference の 50% 割引には及びません。 選択肢Dの SageMaker 非同期推論エンドポイントはモデルのセルフホスティングのため、インフラのプロビジョニング・スケーリング・モデル管理をすべて自社で担う必要があり運用複雑性が大幅に増します。