ゲーム会社がAIエージェントにボードゲームを学習させている。エージェントは対局の結果(勝ち・負け)のみをフィードバックとして受け取り、試行錯誤しながら戦略を自律的に改善していく。このシステムで使用されている機械学習の種類はどれか?
強化学習(Reinforcement Learning)は、エージェントが環境と相互作用し行動に対する報酬(正・負)を受け取ることで最適な方策を学習する手法です。ボードゲームAI(AlphaGoなど)・自律走行・ロボット制御に活用されます。 選択肢Aの教師あり学習と異なり正解データは不要で、試行錯誤から学習する点が特徴です。 選択肢Bの教師なし学習はラベルなしデータから隠れたパターンを発見する手法です。 選択肢Dの半教師あり学習は少量のラベル付きデータと大量のラベルなしデータを組み合わせる手法です。