AIF責任あるAIのガイドライン

大規模言語モデル(LLM)を有害なコンテンツを避け人間の価値観・意図に沿った応答をするよう調整するために広く使用される手法「RLHF」として正しいものはどれですか?

A
Reinforcement Learning from Human Feedback(人間のフィードバックからの強化学習):人間の評価者がモデル出力の優劣を比較評価し、その情報を強化学習でモデルに反映する手法
✓ 正解
RLHF(Reinforcement Learning from Human Feedback)は、人間の評価者がモデルの複数の応答を比較・ランク付けし、その好み情報を報酬モデルに変換、強化学習でLLMを微調整する手法です。有害・有毒なコンテンツを回避し、人間の意図に整合した応答を生成するAIアライメントの主要技術です。
B
Retrieval Learning with Historical Facts(履歴情報を用いた検索学習):過去の正解データを検索してモデルの応答を上書きする手法
過去の正解データを単に検索して上書きする手法は存在せず、実際のモデル学習には対応していない造語です。
C
Rule-based Learning with Heuristic Filtering(ヒューリスティックフィルタリングを用いたルールベース学習):あらかじめ定義したルールでモデル出力を事後フィルタリングする手法
ルールベースの事後フィルタリングではモデル自体の改善にはならず、応答品質の根本的な向上を実現できません。
D
Recurrent Learning with High-Frequency tokens(高頻度トークンを用いた再帰的学習):出現頻度の高いトークンパターンを強調して再学習する手法
トークン頻度による再学習は存在しない手法であり、LLMの微調整メカニズムと不一致です。

解説

正解: Reinforcement Learning from Human Feedback(人間のフィードバックからの強化学習):人間の評価者がモデル出力の優劣を比較評価し、その情報を強化学習でモデルに反映する手法。 RLHF(Reinforcement Learning from Human Feedback)は、人間の評価者がモデルの複数の応答を比較・ランク付けし、その好み情報を報酬モデルに変換、強化学習でLLMを微調整する手法。有害・有毒なコンテンツを回避し、人間の意図に整合した応答を生成するAIアライメントの主要技術。Amazon Bedrockで提供されるモデル群もこの手法で学習されている。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る