リーガルテック企業が、Amazon Bedrock Custom Model Fine-Tuningで契約条項分類に特化したモデルを作成しました。5万件のラベル付きデータでファインチューニングを実施しており、本番展開前に、専門家がアノテーションした500件のテストデータを使ってファインチューニング済みモデルとベースモデルの性能差を客観的に測定する必要があります。最も適切な評価アプローチはどれですか。
Amazon Bedrock Model Evaluationの自動評価(Automatic)モードでは、アップロードした評価データセット(プロンプトとground truth)に対してベースモデルとファインチューニング済みモデルの出力を生成し、精度・ROUGE-L・BERTScoreなどのタスク別メトリクスで定量比較できる。500件のラベル付きテストデータを活用して本番展開前に統計的根拠のある客観的比較を行うことができる、最も効率的かつ再現性の高い手法である。 選択肢AのBedrock Playgroundによる定性評価は20件程度の少数サンプル確認には有用だが、500件の統計的評価に対応できず、評価者の主観的判断に依存するため客観性に欠ける。 選択肢Cの本番トラフィックへの段階的ロールアウトは十分な評価が完了する前に本番ユーザーに未検証モデルを提供することになり、リスク管理の観点から不適切である。 選択肢Dのトレーニング損失カーブの比較はモデルの収束確認には有用だが、実際の契約条項分類タスクにおけるビジネス精度を直接測定するものではない。