リーガルテック企業が Amazon Bedrock Custom Models を使用して契約書サマリー生成モデルをファインチューニングしました。Amazon Bedrock Model Evaluation を使用してベースモデルとファインチューニング済みモデルを比較します。評価要件は①参照サマリーとの意味的類似度、 ②重要な法的条項の網羅性、 ③元の契約書に存在しない法的用語のハルシネーション(幻覚:AIが事実に基づかない情報を生成すること)の有無、の3つです。すべての要件を最も包括的にカバーする評価アプローチはどれですか?
自動評価メトリクス(BERTScore・ROUGE)は意味的類似度や表層的一致度を効率的に測定できるが、重要条項の網羅性やドメイン特有のハルシネーション検出には法律専門家によるヒューマン評価が不可欠である。Bedrock Model Evaluation は自動評価と人間評価の両方をサポートしており、高リスクな法律ドメインでは組み合わせが最善策となる。