AIF生成AIの基礎

BLEUスコアについて正しい説明はどれですか。

A
生成文と参照文の一致度をn-gramベースで評価する指標である
✓ 正解
BLEUは生成された文章と正解例とのn-gram一致率を利用する評価指標です。特に機械翻訳や文章生成タスクで広く利用される代表的な自動評価方法です。
B
画像分類モデルの精度を測定するための代表的な指標である
画像分類ではAccuracyやPrecision、Recallなどが一般的です。BLEUはテキスト生成を対象とした評価指標であり画像分類には使用されません。
C
埋め込みベクトルの類似度だけを評価する手法である
埋め込みベクトルの意味的類似性を評価する指標ではありません。BLEUは単語列の一致を基に計算されるため、意味が近くても低スコアになる場合があります。
D
モデルの推論速度を測定する性能指標である
BLEUは生成品質の評価指標であり、推論時間や処理速度などシステム性能を測定するベンチマークではありません。

解説

BLEUは機械翻訳や文章生成において、生成文と参照文のn-gram一致率を基に品質を評価する代表的な自動評価指標です。ただし意味を完全に評価できるわけではないため、人手評価や他の指標と組み合わせて利用されることもあります。画像分類の精度評価や推論速度測定には利用されず、埋め込みベクトルのみを評価する指標でもありません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る