AIF生成AIの基礎
あなたのチームは自社開発の機械翻訳モデルを評価しています。人間のアノテーターをスケールさせることが難しい状況で、翻訳品質を自動的かつ大量に評価したいと考えています。この目的に最も広く使用される評価指標はどれですか?
Aパープレキシティ(Perplexity)— モデルがテキストを予測する際の不確実性の指標
パープレキシティはモデルが次の単語を予測する際の不確実性を示す指標で、言語モデルの評価には用いられますが、参照翻訳とのn-gram一致を測る機械翻訳品質の自動評価指標としては適しません。
BBLEUスコア(Bilingual Evaluation Understudy)— 生成テキストと参照テキストのn-gram一致率
✓ 正解
BLEUスコアは生成テキストと参照翻訳のn-gram一致度を計算する自動評価指標で、機械翻訳評価の標準指標として広く使われます。0〜1で表され値が高いほど品質が高いとされます。
CF1スコア — 適合率と再現率の調和平均
F1スコアは適合率と再現率の調和平均であり、分類タスクの性能評価に用いる指標で、翻訳品質の自動評価には適しません。
DAUC-ROC — 分類モデルの性能を示す曲線下面積(Area Under the Curve - Receiver Operating Characteristic)
AUC-ROCは分類モデルの性能を示す曲線下面積であり、二値分類などの評価に用いる指標で、翻訳品質の自動評価には適しません。
解説
BLEUスコアは生成テキストと参照翻訳のn-gram(連続する単語列)一致度を計算する自動評価指標で、機械翻訳評価の標準指標として広く使われます。0〜1で表され値が高いほど品質が高いとされます。
選択肢Aのパープレキシティはモデルがテキストを予測する際の不確実性(予測の難しさ)を示す指標で、言語モデルの評価には使われますが、参照翻訳との一致を測る機械翻訳品質の自動評価には不向きです。
選択肢CのF1スコアは適合率と再現率の調和平均であり、分類タスク向けの指標です。
選択肢DのAUC-ROCは分類モデルの性能を示す曲線下面積であり、分類タスク向けの指標です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →