AIF生成AIの基礎

大規模言語モデル(LLM)が有害なコンテンツを生成したり、ユーザーの意図とずれた回答をしたりしないよう、人間の価値観に沿うように調整する手法として現代の主要な生成AIシステムで広く採用されているアプローチはどれですか?

A
転移学習(Transfer Learning):大量データで事前学習したモデルを別タスクに適用する手法
転移学習(Transfer Learning):大量データで事前学習したモデルを別タスクに適用する手法は、モデルの汎化に関する手法であり、アライメントではありません。
B
データ拡張(Data Augmentation):学習データを人工的に増やす手法
データ拡張(Data Augmentation):学習データを人工的に増やす手法は、学習データの増量に関する手法であり、アライメントではありません。
C
RLHF(Reinforcement Learning from Human Feedback):人間のフィードバックを報酬として強化学習を行う手法
✓ 正解
RLHFは人間が好ましい出力と好ましくない出力を評価し、その結果を報酬モデルとして強化学習でLLMを微調整する技術です。ChatGPTやClaude等の主要なLLMで採用されており、安全性と有用性のバランスを取るためのアライメント手法として確立されています。
D
バギング(Bagging):複数のモデルの出力を多数決で統合するアンサンブル手法
バギング(Bagging):複数のモデルの出力を多数決で統合するアンサンブル手法は、アンサンブル学習に関する手法であり、アライメントではありません。

解説

RLHFは人間が好ましい出力と好ましくない出力を評価し、その結果を報酬モデルとして強化学習でLLMを微調整する技術です。ChatGPTやClaude等の主要なLLMで採用されており、安全性と有用性のバランスを取るためのアライメント手法として確立されています。 選択肢Aの転移学習(Transfer Learning):大量データで事前学習したモデルを別タスクに適用する手法は、モデルの汎化に関する手法であり、アライメントではありません。 選択肢Bのデータ拡張(Data Augmentation):学習データを人工的に増やす手法は、学習データの増量に関する手法であり、アライメントではありません。 選択肢Dのバギング(Bagging):複数のモデルの出力を多数決で統合するアンサンブル手法は、アンサンブル学習に関する手法であり、アライメントではありません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る