無限ノック › AIF 練習問題一覧 › 問題
AIF生成AIの基礎

ChatGPTやClaudeなどの最新の大規模言語モデル(LLM)が、有害なコンテンツを生成せずユーザーの意図に沿った安全な応答を返せるよう「アライメント(人間の価値観・意図との整合)」を実現するために広く採用されている学習手法はどれですか?

A
転移学習(Transfer Learning):大規模データで事前学習したモデルを特定タスク向けに再利用する手法
転移学習(Transfer Learning) は大規模データで事前学習したモデルを特定タスク向けに再利用する手法であり、アライメントには直接使われません。
B
RLHF(人間のフィードバックによる強化学習):人間の評価者による選好データを報酬信号としてモデルを強化学習で微調整する手法
✓ 正解
RLHF(人間のフィードバックによる強化学習)は、①人間の評価者が複数のモデル出力を比較・選好データとして収集、②その選好データで報酬モデルを学習、③報酬モデルによる強化学習でLLMを微調整、という三段階で構成される。ChatGPT・Claude・Gemini等の主要LLMのアライメント手法として採用されている。
C
データ拡張(Data Augmentation):既存の学習データに変換・加工を加えてデータ量を増やし汎化性能を高める手法
データ拡張(Data Augmentation) は有用なML手法ですがアライメントには直接使われません。
D
知識蒸留(Knowledge Distillation):大規模モデルの出力を使って小規模モデルを学習させる圧縮手法
知識蒸留(Knowledge Distillation) は大規模モデルの出力を使って小規模モデルを学習させる圧縮手法であり、アライメントには直接使われません。

解説

RLHF(人間のフィードバックによる強化学習)は、①人間の評価者が複数のモデル出力を比較・選好データとして収集、 ②その選好データで報酬モデルを学習、 ③報酬モデルによる強化学習でLLMを微調整、という三段階で構成される。ChatGPT・Claude・Gemini等の主要LLMのアライメント手法として採用されている。 選択肢Aの 転移学習(Transfer Learning) は大規模データで事前学習したモデルを特定タスク向けに再利用する手法であり、アライメントには直接使われません。 選択肢Cの データ拡張(Data Augmentation) は有用なML手法ですがアライメントには直接使われません。 選択肢Dの 知識蒸留(Knowledge Distillation) は大規模モデルの出力を使って小規模モデルを学習させる圧縮手法であり、アライメントには直接使われません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIF の問題一覧に戻る