大規模言語モデル(LLM)の開発において、事前学習済みモデルを「有害なコンテンツを避け、誠実で役立つ回答をする」という人間の価値観に整合させるために広く採用されているトレーニング手法として最も適切なものはどれですか?
RLHF(人間のフィードバックによる強化学習)は、人間のレビュアーがモデルの複数の出力を比較・評価し、その評価から報酬モデルを学習させ、PPO(近接方策最適化)などの強化学習アルゴリズムでLLMを最適化する手法です。ChatGPTやAnthropic Claudeなど現代のLLMが有害出力を避け指示に従うためのアライメント(人間の価値観への整合)に不可欠です。 選択肢Aのデータ拡張(Data Augmentation)は、既存データに変換・加工を加えてデータ量を増やす手法ですが、アライメントを直接扱う手法ではありません。 選択肢Bの転移学習(Transfer Learning)は、別タスクで学習済みの重みを新タスクに流用する手法ですが、アライメントを直接扱う手法ではありません。 選択肢Dの自己教師あり学習(Self-supervised Learning)は、データ自体からラベルを自動生成して学習する手法ですが、アライメントを直接扱う手法ではありません。