法律事務所がAmazon Bedrock Model Evaluationを使用して、契約書サマリー生成タスクに最適な基盤モデルを選定しています。弁護士が作成した参照サマリー500件が用意されており、以下の評価基準があります: ・法律文書特有の言い換え・同義語表現の豊富さ(語彙の多様性) ・ハルシネーション(原文にない情報の作り込み)の検出 ・500件規模での自動評価によるコスト効率化 最も適した評価指標の組み合わせはどれか? ※ROUGE:テキストの語彙的重複度を測る自動評価指標(Recall-Oriented Understudy for Gisting Evaluation) ※BERTScore:BERTの文脈的埋め込みを用いた意味的類似度指標 ※BLEU:n-gram(連続する単語列)の重複率を測る自動評価指標(Bilingual Evaluation Understudy) ※LLM-as-judge:LLMが出力品質を自動採点する評価手法
選択肢BのBERTScoreは文脈的埋め込みで意味的類似性を評価するため、法律文書の同義語・言い換えに対応できます。LLM-as-judge機能は生成テキストが参照文書の内容のみを反映しているかを自動評価でき、500件規模でもコスト効率が高く、3つの評価基準をすべて満たします。 選択肢AのROUGE-LとROUGE-2は、テキストの語彙的重複度を測る指標であり、同義語や言い換えが多い法律文書では意味的正確性を正確に評価できません。 選択肢CのBLEUはn-gramの重複率を測る指標で、ROUGEと同様に語彙的重複に依存するため法律サマリー評価には不適切です。 選択肢Dの人間評価のみでは、500件規模での実施にコストと時間が過剰にかかり、スケーラビリティを欠きます。