AIF生成AIの基礎

最近の高性能な大規模言語モデル(例:Mixtral等)の一部が採用している「Mixture of Experts(MoE:専門家の混合)」アーキテクチャの特徴として正しいものはどれですか?

A
複数の独立した小型モデルを並列実行し、最多得票の回答を最終出力として採用する投票型アンサンブル手法
アンサンブル学習は、複数の独立したモデルを並列実行するものであり、単一モデル内のサブネットワークを動的に選択するMoEとは根本的に異なります。
B
入力トークンごとに「ルーター(ゲーティングネットワーク)」が少数の「エキスパート」サブネットワークのみを選択的に活性化し、総パラメータ数は多くとも推論時の実際の計算量を削減するアーキテクチャ
✓ 正解
MoEは「ルーター(ゲーティングネットワーク)」が各入力トークンに対して全エキスパートの中から少数(例:上位2つ)だけを選択して活性化するアーキテクチャです。これによりモデル全体のパラメータ数(容量)は大きく保ちながら、推論時の実際の計算量(FLOPs)を削減し、コスト効率の高い高性能モデルが実現できます。
C
学習データを複数の専門ドメインに分割し、それぞれ専用モデルを個別に訓練した後に統合する分割統治型の学習戦略
ドメイン分割学習は、学習データを複数の専門ドメインに分割するものであり、MoEとは別概念です。
D
ニューラルネットワークの各層が異なるタスクを専門に処理するよう、学習を通じて自動的に特化していく自己組織化機構
自己組織化マップなど別種のアーキテクチャは、MoEの動作原理とは異なります。

解説

MoEは「ルーター(ゲーティングネットワーク)」が各入力トークンに対して全エキスパートの中から少数(例:上位2つ)だけを選択して活性化するアーキテクチャです。これによりモデル全体のパラメータ数(容量)は大きく保ちながら、推論時の実際の計算量(FLOPs)を削減し、コスト効率の高い高性能モデルが実現できます。 選択肢Aのアンサンブル学習は、複数の独立したモデルを並列実行するものであり、単一モデル内のサブネットワークを動的に選択するMoEとは根本的に異なります。 選択肢Cのドメイン分割学習は、学習データを複数の専門ドメインに分割するものであり、MoEとは別概念です。 選択肢Dの自己組織化マップなど別種のアーキテクチャは、MoEの動作原理とは異なります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る