無限ノック › AIP 練習問題一覧 › 問題
AIPテスト、検証、トラブルシューティング

法律事務所がAmazon Bedrock Model Evaluationを使用して、契約書サマリー生成タスクに最適な基盤モデルを選定しています。弁護士が作成した参照サマリー500件が用意されており、以下の評価基準があります: ・法律文書特有の言い換え・同義語表現の豊富さ(語彙の多様性) ・ハルシネーション(原文にない情報の作り込み)の検出 ・500件規模での自動評価によるコスト効率化 最も適した評価指標の組み合わせはどれか? ※ROUGE:テキストの語彙的重複度を測る自動評価指標(Recall-Oriented Understudy for Gisting Evaluation) ※BERTScore:BERTの文脈的埋め込みを用いた意味的類似度指標 ※BLEU:n-gram(連続する単語列)の重複率を測る自動評価指標(Bilingual Evaluation Understudy) ※LLM-as-judge:LLMが出力品質を自動採点する評価手法

A
ROUGE-LとROUGE-2を組み合わせて語彙的重複を主要指標として評価する
ROUGEはテキストの語彙的重複度を測る指標で、参照サマリーとの単語・フレーズの一致率を評価します。法律文書は同義語・言い換えが多いため、語彙的重複に依存するROUGEでは意味的正確性を適切に評価できず、法律サマリー評価に不適切です。
B
BERTScoreで意味的類似度を評価し、LLM-as-judgeでハルシネーションを自動検出する
✓ 正解
BERTScoreは文脈的埋め込みで意味的類似性を評価するため、法律文書の同義語・言い換えに対応できます。LLM-as-judgeはハルシネーション(原文にない情報の作り込み)を自動検出でき、500件規模での自動評価によるコスト効率化の要件も満たします。
C
BLEUスコアのみを計算して語彙的重複を主要評価指標として使用する
BLEUはn-gramの重複率を測る機械翻訳評価指標で、語彙的重複に依存します。ROUGEと同様に同義語・言い換えが豊富な法律文書では意味的正確性を捉えられず、単独指標としては法律サマリーの評価精度が不十分です。
D
弁護士が500件すべての要約を手作業でレビューする人間評価(Human Evaluation)のみを実施する
人間評価は高品質ですが、500件全件を弁護士が手作業でレビューするとコストと時間が膨大にかかります。自動評価によるコスト効率化という要件を満たせず、スケーラビリティに欠けるため実用的ではありません。

解説

選択肢BのBERTScoreは文脈的埋め込みで意味的類似性を評価するため、法律文書の同義語・言い換えに対応できます。LLM-as-judge機能は生成テキストが参照文書の内容のみを反映しているかを自動評価でき、500件規模でもコスト効率が高く、3つの評価基準をすべて満たします。 選択肢AのROUGE-LとROUGE-2は、テキストの語彙的重複度を測る指標であり、同義語や言い換えが多い法律文書では意味的正確性を正確に評価できません。 選択肢CのBLEUはn-gramの重複率を測る指標で、ROUGEと同様に語彙的重複に依存するため法律サマリー評価には不適切です。 選択肢Dの人間評価のみでは、500件規模での実施にコストと時間が過剰にかかり、スケーラビリティを欠きます。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る