機械学習の分散トレーニングワークロードをAWS上で実行する予定です。このワークロードは、非常に高いコンピューティング能力を必要とし、かつインスタンス間で低レイテンシなノード間通信が必要です。どの構成を選択すべきですか?
クラスタープレイスメントグループが単一のアベイラビリティーゾーン内でインスタンスを物理的に近くに配置し、極めて低いネットワークレイテンシを実現するためです。さらにEFAを使用することで、HPC(High Performance Computing:高性能コンピューティング)や機械学習の分散トレーニングに必要な高速なノード間通信(OSバイパス通信)が可能になります。 選択肢Aの プレイスメントグループの「分散 (Spread)」は、信頼性を高めるための配置であり、レイテンシ短縮には向きません。 選択肢Cの インスタンスを複数のアベイラビリティーゾーンに均等に配置することは、AZ間通信が発生するため、低レイテンシ要件に反します。 選択肢Dの Amazon ECSのタスク配置戦略で「binpack」を使用することは、リソース効率の最適化であり、ネットワーク性能の向上には寄与しません。