最近の高性能な大規模言語モデル(例:Mixtral等)の一部が採用している「Mixture of Experts(MoE:専門家の混合)」アーキテクチャの特徴として正しいものはどれですか?
MoEは「ルーター(ゲーティングネットワーク)」が各入力トークンに対して全エキスパートの中から少数(例:上位2つ)だけを選択して活性化するアーキテクチャです。これによりモデル全体のパラメータ数(容量)は大きく保ちながら、推論時の実際の計算量(FLOPs)を削減し、コスト効率の高い高性能モデルが実現できます。 選択肢Aのアンサンブル学習は、複数の独立したモデルを並列実行するものであり、単一モデル内のサブネットワークを動的に選択するMoEとは根本的に異なります。 選択肢Cのドメイン分割学習は、学習データを複数の専門ドメインに分割するものであり、MoEとは別概念です。 選択肢Dの自己組織化マップなど別種のアーキテクチャは、MoEの動作原理とは異なります。