無限ノック › AIF 練習問題一覧 › 問題
AIF生成AIの基礎

大規模言語モデル(LLM)の開発において、事前学習済みモデルを「有害なコンテンツを避け、誠実で役立つ回答をする」という人間の価値観に整合させるために広く採用されているトレーニング手法として最も適切なものはどれですか?

A
データ拡張(Data Augmentation):既存データに変換・加工を加えてデータ量を増やす手法であり、モデル汎化の向上に使われる
データ拡張(Data Augmentation)は、既存データに変換・加工を加えてデータ量を増やす手法ですが、アライメントを直接扱う手法ではありません。
B
転移学習(Transfer Learning):別タスクで学習済みの重みを新タスクに流用する手法であり、少ないデータで高性能を実現する
転移学習(Transfer Learning)は、別タスクで学習済みの重みを新タスクに流用する手法ですが、アライメントを直接扱う手法ではありません。
C
人間のフィードバックによる強化学習(RLHF):人間の評価を報酬として強化学習でモデルを最適化し、安全で役立つ出力に整合させる手法
✓ 正解
RLHF(人間のフィードバックによる強化学習)は、人間のレビュアーがモデルの複数の出力を比較・評価し、その評価から報酬モデルを学習させ、PPO(近接方策最適化)などの強化学習アルゴリズムでLLMを最適化する手法です。ChatGPTやAnthropic Claudeなど現代のLLMが有害出力を避け指示に従うためのアライメント(人間の価値観への整合)に不可欠です。
D
自己教師あり学習(Self-supervised Learning):ラベルなしデータから自動的に教師信号を生成して学習する手法であり、事前学習に広く使われる
自己教師あり学習(Self-supervised Learning)は、データ自体からラベルを自動生成して学習する手法ですが、アライメントを直接扱う手法ではありません。

解説

RLHF(人間のフィードバックによる強化学習)は、人間のレビュアーがモデルの複数の出力を比較・評価し、その評価から報酬モデルを学習させ、PPO(近接方策最適化)などの強化学習アルゴリズムでLLMを最適化する手法です。ChatGPTやAnthropic Claudeなど現代のLLMが有害出力を避け指示に従うためのアライメント(人間の価値観への整合)に不可欠です。 選択肢Aのデータ拡張(Data Augmentation)は、既存データに変換・加工を加えてデータ量を増やす手法ですが、アライメントを直接扱う手法ではありません。 選択肢Bの転移学習(Transfer Learning)は、別タスクで学習済みの重みを新タスクに流用する手法ですが、アライメントを直接扱う手法ではありません。 選択肢Dの自己教師あり学習(Self-supervised Learning)は、データ自体からラベルを自動生成して学習する手法ですが、アライメントを直接扱う手法ではありません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIF の問題一覧に戻る