自然言語処理モデルを評価する際、人間による評価を実施する最大の理由として最も適切なものはどれですか。
BLEUなどの自動評価指標は一定の目安になりますが、文章の自然さや読みやすさ、文脈の妥当性、有用性などは人間による評価が不可欠です。そのため、実際の生成AI評価では自動評価と人間評価を組み合わせることが一般的です。GPU使用率やモデルサイズはシステム性能に関する指標であり、生成品質そのものを評価するものではありません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。