AIFAIとMLの基礎

生成AIの回答品質を人間が評価する方法として最も適切なものはどれですか。

A
自然さや正確性などの観点で人間が回答をレビューする
✓ 正解
人間による評価では自然さ、正確性、有用性など複数の観点から生成結果を総合的に判断できます。
B
BLEUだけを確認すれば品質は完全に判断できる
BLEUは翻訳評価で有効ですが、人間の感じる品質を完全に表現できるわけではありません。
C
推論時間だけを比較して品質を評価する
推論時間はシステム性能を示す指標であり、生成内容の品質そのものとは無関係です。
D
GPU使用率だけを比較して品質を評価する
GPU使用率はインフラ利用状況であり、回答品質を評価する指標ではありません。

解説

生成AIの品質評価ではBLEUなどの自動評価指標も利用されますが、自然さや有用性、事実性などは人間による評価が重要です。特に対話AIや要約では、自動指標だけでは十分に品質を測れないことがあります。推論時間やGPU使用率は性能やコストの指標であり、生成内容そのものの品質評価には利用できません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る