AIF生成AIの基礎
機械翻訳モデルの性能評価において、生成された翻訳文と参照訳との一致度を測定する代表的な評価指標はどれですか。
ABLEU
✓ 正解
BLEUは翻訳品質を自動評価する代表的な指標であり、参照訳との一致度を数値化できます。
BF1スコア
F1スコアは分類問題における適合率と再現率を組み合わせた評価指標であり、翻訳評価には利用しません。
CROC-AUC
ROC-AUCは分類器の識別性能を評価するための指標であり、文章生成品質の評価には適しません。
DRMSE
RMSEは回帰問題の予測誤差を評価する指標であり、翻訳品質を評価する目的では使用されません。
解説
BLEUは機械翻訳の品質評価で広く利用される指標であり、生成文と参照訳とのn-gram一致率などを基にスコアを算出します。F1スコアとROC-AUCは分類問題、RMSEは回帰問題の評価指標です。AIF試験では、タスクに応じて適切な評価指標を選択できることが求められます。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →