大規模言語モデル(LLM)が有害なコンテンツを生成したり、ユーザーの意図とずれた回答をしたりしないよう、人間の価値観に沿うように調整する手法として現代の主要な生成AIシステムで広く採用されているアプローチはどれですか?
RLHFは人間が好ましい出力と好ましくない出力を評価し、その結果を報酬モデルとして強化学習でLLMを微調整する技術です。ChatGPTやClaude等の主要なLLMで採用されており、安全性と有用性のバランスを取るためのアライメント手法として確立されています。 選択肢Aの転移学習(Transfer Learning):大量データで事前学習したモデルを別タスクに適用する手法は、モデルの汎化に関する手法であり、アライメントではありません。 選択肢Bのデータ拡張(Data Augmentation):学習データを人工的に増やす手法は、学習データの増量に関する手法であり、アライメントではありません。 選択肢Dのバギング(Bagging):複数のモデルの出力を多数決で統合するアンサンブル手法は、アンサンブル学習に関する手法であり、アライメントではありません。