無限ノック › AIP 練習問題一覧 › 問題
AIPテスト、検証、トラブルシューティング

リーガルテック企業が Amazon Bedrock Custom Models を使用して契約書サマリー生成モデルをファインチューニングしました。Amazon Bedrock Model Evaluation を使用してベースモデルとファインチューニング済みモデルを比較します。評価要件は①参照サマリーとの意味的類似度、 ②重要な法的条項の網羅性、 ③元の契約書に存在しない法的用語のハルシネーション(幻覚:AIが事実に基づかない情報を生成すること)の有無、の3つです。すべての要件を最も包括的にカバーする評価アプローチはどれですか?

A
ROUGE スコア(※Recall-Oriented Understudy for Gisting Evaluation:生成テキストと参照テキストの n-gram 一致度を測る自動評価指標)のみを使用した自動評価を実施する
ROUGEは生成テキストと参照テキストのn-gram一致度を測る自動評価指標ですが、法律条項の網羅性やハルシネーション有無の判定には不十分です。
B
BERTScore(※BERT:Bidirectional Encoder Representations from Transformers ベースの意味的類似度スコア)のみを使用した自動評価を実施する
BERTScoreは意味的類似度を測定しますが、法律ドメイン特有のハルシネーション検出や重要条項の網羅性評価には法律専門家による評価が必要です。
C
BERTScore や ROUGE などの自動評価メトリクスと法律専門家によるヒューマン評価を Amazon Bedrock Model Evaluation で組み合わせ、意味的類似度・条項網羅性・ハルシネーション有無を総合評価する
✓ 正解
BERTScoreやROUGEなどの自動評価と法律専門家によるヒューマン評価を組み合わせることで、意味的類似度・条項網羅性・ハルシネーション有無を総合評価できます。高リスク法律ドメインではこの組み合わせが最善策です。
D
推論コストとトークン生成レイテンシのみを評価指標として使用し、最もコスト効率の高いモデルを本番環境に選定する
推論コストとレイテンシのみを評価指標にすると、生成品質やドメイン要件への適合性を見落とす可能性があり、不十分です。

解説

自動評価メトリクス(BERTScore・ROUGE)は意味的類似度や表層的一致度を効率的に測定できるが、重要条項の網羅性やドメイン特有のハルシネーション検出には法律専門家によるヒューマン評価が不可欠である。Bedrock Model Evaluation は自動評価と人間評価の両方をサポートしており、高リスクな法律ドメインでは組み合わせが最善策となる。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る