AIP実装と統合複数選択

ある金融機関がAmazon Bedrockでファインチューニングしたカスタムモデルを使用して、決算短信(企業の財務報告書)の要約を生成するシステムを本番稼働させようとしています。Bedrock Model Evaluationを使用してこのモデルを評価する際、財務要約の品質を最も包括的に評価できる自動評価メトリクスの組み合わせはどれですか?(2つ選択)

A
ROUGE(Recall-Oriented Understudy for Gisting Evaluation:参照テキストとの単語・フレーズの一致率を測定する自動評価指標)
✓ 正解
ROUGEは参照テキストとの語彙的一致を測定し、財務要約における重要な数値・企業名・財務用語が含まれているかを評価するため総合評価に必要です。
B
BERTScore(BERTモデルを使用して生成テキストと参照テキストの意味的類似性をコサイン類似度で測定する評価指標)
✓ 正解
BERTScoreは文脈的埋め込みで意味的類似性を測定するため、表現が異なっても内容が正確な要約を高評価でき、パラフレーズ対応で重要です。
C
パープレキシティ(Perplexity:言語モデルがテキストを予測する際の不確実性を示す指標で、値が低いほど流暢なテキスト)
パープレキシティはテキスト流暢さの指標であり、要約の正確性や品質評価には不向きな指標です。
D
Exact Match(完全一致:生成テキストと参照テキストが文字列レベルで完全に一致するかを測定する指標)
Exact Matchは自然言語の多様な表現を許容せず、同義表現でも低評価になるため、要約評価には過度に厳格です。

解説

財務要約の評価にはROUGEとBERTScoreの組み合わせが最適です。ROUGEは参照要約との語彙的一致(重要な数値・企業名・財務用語が含まれているか)を測定します。BERTScoreは意味的類似性を測定するため、表現が異なっても内容が正確な要約を高評価できます。 選択肢CのパープレキシティはLLMがテキストをどれだけ流暢に予測できるかを示す指標であり、要約の情報正確性や網羅性の評価には直接使用できません。 選択肢DのExact Matchは生成テキストと参照テキストの完全一致のみを評価するため、自然言語の多様な表現を許容せず、要約評価には過度に厳格すぎます。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIP の問題一覧に戻る