AIF生成AIの基礎
AIスタートアップが大規模言語モデル(LLM)の研究・開発ロードマップを立案しています。Kaplan et al.(2020年)の研究で提唱された「スケーリング則(Scaling Laws)」によれば、LLMの性能(損失の低減)を左右する最も重要な3つの要因の組み合わせとして正しいものはどれですか?
Aモデルのパラメータ数・学習データ量・計算量(FLOPs:浮動小数点演算回数)
✓ 正解
スケーリング則(Scaling Laws)はモデルのパラメータ数(N)、学習データ量(D)、計算量(FLOPs)の3要素増加でモデル損失がべき乗則で改善することを示す経験則です。LLM大規模化を推進した重要発見です。
Bアテンションヘッド数・レイヤー数・隠れ層の次元数
アテンションヘッド数、レイヤー数、隠れ層の次元数はアーキテクチャ設計の詳細パラメータですが、スケーリング則が定義する主要な3要素ではありません。
Cファインチューニングのデータ量・プロンプト長・推論時の温度(Temperature)パラメータ
ファインチューニングデータ量や推論時のTemperatureパラメータは、事前学習フェーズのスケーリング則の対象外です。スケーリング則は主に事前学習に焦点を当てています。
D学習率(Learning Rate)・バッチサイズ・ドロップアウト率
学習率、バッチサイズ、ドロップアウト率はトレーニングのハイパーパラメータであり、スケーリング則が定義する主要な3要素(N、D、FLOPs)の一部ではありません。
解説
スケーリング則(Scaling Laws)とは、モデルのパラメータ数(N)・学習データ量(D)・計算量(C:FLOPs)の3要素が増加するにつれてモデルの損失が予測可能なべき乗則で改善することを示した経験則です。この発見がLLMの大規模化を加速させました。アテンションヘッド数・レイヤー数・次元数はアーキテクチャ設計の詳細パラメータですが、スケーリング則が定義する3要素ではありません。ファインチューニングデータ量や推論パラメータ(Temperature)は事前学習フェーズのスケーリング則の対象外です。学習率・バッチサイズ・ドロップアウト率はハイパーパラメータであり、スケーリング則の主要因として定義されていません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →