大規模言語モデル(LLM)を有害なコンテンツを避け人間の価値観・意図に沿った応答をするよう調整するために広く使用される手法「RLHF」として正しいものはどれですか?
正解: Reinforcement Learning from Human Feedback(人間のフィードバックからの強化学習):人間の評価者がモデル出力の優劣を比較評価し、その情報を強化学習でモデルに反映する手法。 RLHF(Reinforcement Learning from Human Feedback)は、人間の評価者がモデルの複数の応答を比較・ランク付けし、その好み情報を報酬モデルに変換、強化学習でLLMを微調整する手法。有害・有毒なコンテンツを回避し、人間の意図に整合した応答を生成するAIアライメントの主要技術。Amazon Bedrockで提供されるモデル群もこの手法で学習されている。