ある医療機器メーカーが、Amazon Bedrockでカスタムファインチューニングしたモデルを使い、1日1,000万件の機器ログの異常分類をリアルタイムで処理しています。現在の月間推論コストは$50,000で、Provisioned Throughputのコスト最適化を適用してもコスト削減目標(70%以上)に届かない状況です。同等の分類精度を維持しながら追加のコスト削減を達成するための最も適切な戦略はどれですか?
Amazon Bedrock Model Distillationは大規模な教師モデルの知識を小型の生徒モデルに転移させる手法で、タスク固有の性能を保持しながら推論コストを大幅削減(70%以上も可能)できます。ファインチューニング済みモデルを教師として使用でき、カスタマイズによる精度向上も引き継げます。 Provisioned Throughputの長期コミットメントは通常20〜30%削減に留まり70%目標には届きません。 Bedrock Batch Inferenceは非同期バッチ処理向けのサービスであり、1日1,000万件の機器ログをリアルタイムで異常分類する本ユースケースには不適です。バッチ処理への移行で機器障害の即時検知が不可能になり安全性が損なわれます。 ファインチューニングなしのベースモデルへの切替は、医療機器ログ分類に特化したカスタムモデルの分類精度優位性が失われ、同等の精度維持という要件に反します。