AIFAIとMLの基礎
ある病院が重篤な感染症の診断支援AIを導入しようとしています。健康な患者を誤って陽性と判定した場合(偽陽性)は不必要な治療による患者負担が生じ、感染患者を見逃した場合(偽陰性)は生命の危機につながります。医療チームは適合率(Precision)と再現率(Recall)を等しく重視した単一の評価指標を使いたいと考えています。最も適切な評価指標はどれですか?
A精度(Accuracy):全予測サンプルのうち正しく分類できた割合で示す基本的な評価指標
精度(Accuracy)はクラス不均衡データで誤解を招く。感染者が少数の場合、全員を健康と予測するだけで高い精度が得られてしまい、診断モデルとして機能しているかを正しく評価できない。
B適合率(Precision):陽性と予測したサンプルのうち実際に陽性だった割合を最大化する指標
適合率(Precision)は偽陽性の最小化に特化した指標であり、見逃し(偽陰性)のコストを考慮しない。感染患者を見逃すリスクがある本問のシナリオでは、単独では不十分な評価指標となる。
CF1スコア:適合率と再現率の調和平均を取り、両指標を同等に考慮して評価する指標
✓ 正解
F1スコアは適合率と再現率の調和平均であり、どちらか一方が低い場合にスコアが低下するため、両指標のバランスを等しく評価できる。偽陽性・偽陰性の両方にコストがある医療診断に最適な単一指標。
D特異度(Specificity):実際の陰性サンプルを正しく陰性と判定できた割合を評価する指標
特異度は実際の陰性サンプルを識別する能力を測るが、偽陰性(感染患者の見逃し)は再現率で評価する。適合率と再現率を等しく考慮するという本問の要件を満たす指標ではない。
解説
F1スコアは適合率(Precision)と再現率(Recall)の調和平均(2 × Precision × Recall / (Precision + Recall))です。どちらか一方だけが高くもう一方が低い場合はスコアが下がるため、両指標のバランスを強制的に評価できます。クラス不均衡が生じやすい医療診断においてAccuracyより信頼性の高い指標です。
選択肢Aの精度(Accuracy)は感染者が少数のクラス不均衡データでは信頼性が低く、全員を健康と予測するだけで高い値が出てしまい、診断モデルの真の性能を反映しません。
選択肢Bの適合率(Precision)は偽陽性を減らすのに有効ですが、見逃し(偽陰性)のコストを無視するため、感染患者の見落としリスクを評価できません。
選択肢Dの特異度(Specificity)は健康な患者を正しく識別する能力を測る指標であり、偽陰性(感染患者の見逃し)を直接評価するものではなく、両指標を等しく考慮する要件を満たしません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →