ある工場では、ロボットアームが製品を掴んで仕分けする動作を自律的に習得するシステムを構築しています。ロボットは試行錯誤を繰り返しながら、成功した動作には報酬が与えられ、失敗した動作には罰則が与えられます。このシナリオに最も適した機械学習の手法はどれですか?
強化学習は、エージェント(ロボット)が環境と相互作用しながら、報酬シグナルに基づいて最適な行動方策を学習するパラダイムです。「試行錯誤」「報酬・罰則によるフィードバック」という要素が典型的な強化学習の特徴です。 選択肢Aの教師あり学習は正解ラベルが必要です。 選択肢Bの教師なし学習には報酬の概念がなく、このシナリオには適しません。 選択肢Dの半教師あり学習はラベル付きデータの有効活用が目的であり、このシナリオには適しません。