AIF生成AIの基礎
機械翻訳モデルの性能を評価したいと考えています。生成された翻訳文を正解となる翻訳文と比較して評価する代表的な自動評価指標はどれですか。
ABLEU
✓ 正解
BLEUは生成文と参照文の一致度を測定する代表的な評価指標であり、機械翻訳や一部の生成AIタスクの品質評価に広く利用されています。
BF1スコア
F1スコアは適合率と再現率の調和平均であり、主に分類問題の性能評価に利用されます。翻訳文そのものの品質評価には適していません。
CROC-AUC
ROC-AUCは分類器が正例と負例をどの程度区別できるかを評価する指標です。文章生成や翻訳品質を直接評価する用途ではありません。
D平均絶対誤差(MAE)
MAEは予測値と実測値との差を評価する回帰問題向け指標です。翻訳文の自然さや一致度を評価する目的には適していません。
解説
BLEUは機械翻訳の評価で広く利用される自動評価指標であり、生成された文章と参照訳とのn-gram一致率などを基に品質を数値化します。F1スコアは分類問題の評価、ROC-AUCも二値分類器の性能評価、MAEは回帰問題の誤差評価に用いられるため、翻訳品質の評価には適していません。AIF試験では、タスクごとに適切な評価指標を選択できることが重要です。また、BLEUは人間による評価を完全に置き換えるものではなく、実運用では人手評価と組み合わせて利用されることも理解しておく必要があります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →