大規模言語モデル(LLM: Large Language Model)が有害なコンテンツを回避し、人間の指示に忠実に従うよう調整するために最も広く使用されている手法はどれですか?
RLHFはLLMを人間の価値観に整合させる中心的な手法です。 ①人間の評価者が複数の応答をランク付けして報酬モデルを訓練し、 ②PPO(Proximal Policy Optimization:近接方策最適化)等の強化学習アルゴリズムでLLMが高報酬応答を生成するよう最適化します。 選択肢A の継続事前学習はドメイン知識の追加に使われる手法であり、安全性の整合には直接関係しません。 選択肢C の量子化はモデル圧縮に使われる手法であり、安全性の整合には直接関係しません。 選択肢D のプロンプトキャッシングはレスポンス最適化に使われる技術であり、有害コンテンツの回避とは無関係です。Claude、GPT等の主要LLMはRLHFによって整合されています。