企業は機械学習トレーニングのために p4d.24xlarge インスタンスで大規模 GPU クラスターを構築しており、ノード間で勾配データを高速に交換する MPI ベースの分散トレーニングを実行しています。現在のネットワーク遅延がトレーニング速度のボトルネックとなっており、ネットワーク通信を最適化する必要があります。この要件を満たす最も適切な構成はどれですか?
EFA は OS バイパス機能で MPI ライブラリがカーネルスタックをスキップして超低レイテンシ通信を実現する。クラスタープレイスメントグループで物理的近接を確保することでノード間レイテンシをさらに低減できる。