ChatGPTやClaudeなどの最新の大規模言語モデル(LLM)が、有害なコンテンツを生成せずユーザーの意図に沿った安全な応答を返せるよう「アライメント(人間の価値観・意図との整合)」を実現するために広く採用されている学習手法はどれですか?
RLHF(人間のフィードバックによる強化学習)は、①人間の評価者が複数のモデル出力を比較・選好データとして収集、 ②その選好データで報酬モデルを学習、 ③報酬モデルによる強化学習でLLMを微調整、という三段階で構成される。ChatGPT・Claude・Gemini等の主要LLMのアライメント手法として採用されている。 選択肢Aの 転移学習(Transfer Learning) は大規模データで事前学習したモデルを特定タスク向けに再利用する手法であり、アライメントには直接使われません。 選択肢Cの データ拡張(Data Augmentation) は有用なML手法ですがアライメントには直接使われません。 選択肢Dの 知識蒸留(Knowledge Distillation) は大規模モデルの出力を使って小規模モデルを学習させる圧縮手法であり、アライメントには直接使われません。