AIF生成AIの基礎
Stable DiffusionやAmazon Titanの画像生成モデルが採用している「拡散モデル(Diffusion Model)」の基本的な動作原理として正しいものはどれですか?
A生成器と識別器が競い合って学習するGAN(敵対的生成ネットワーク)の仕組みを画像生成に応用している
GANは生成器と識別器が競い合うアーキテクチャであり、画像生成に使用されます。しかし、これは拡散モデルではなく異なる生成メカニズムです。
Bテキストの意味を解析し、既存の画像データベースから最も類似した画像を組み合わせて出力する
テキスト解析で関連画像を検索・組み合わせる手法は、新規画像の生成ではなく既存資産の再利用であり、拡散モデルの仕組みではありません。
C画像にノイズを段階的に加える順拡散過程を学習し、その逆過程(ノイズ除去)で画像を生成する
✓ 正解
拡散モデルはデータ(画像)に段階的にガウスノイズを加える順拡散と、その逆のノイズ除去の両過程を学習します。テキストプロンプトを条件としながら段階的にノイズを除去して画像を生成し、高品質で安定した学習が実現できます。
DVAE(変分オートエンコーダ)を使って入力テキストを潜在空間に圧縮し、そこからピクセルを直接デコードする
VAE(変分オートエンコーダ)は入力を潜在空間に圧縮・デコードするアーキテクチャですが、拡散モデルとは異なる生成メカニズムです。
解説
拡散モデルは、画像にガウスノイズを少しずつ加えていく「順拡散」過程とその逆の「逆拡散(ノイズ除去)」過程を学習します。生成時はランダムノイズから始め、テキストプロンプト等を条件としながら段階的にノイズを除去して画像を生成します。
選択肢AはGAN(敵対的生成ネットワーク)の説明であり、生成器と識別器が競い合う仕組みを指します。拡散モデルは識別器を持たず、GANとは根本的に異なるアーキテクチャです。
選択肢Bはデータベース検索・組み合わせ型の生成方式の説明であり、拡散モデルは既存画像を組み合わせるのではなく、ノイズ除去により画像をゼロから生成します。
選択肢Cが正しい拡散モデルの動作原理です。順拡散でノイズを加える過程を学習し、逆拡散でノイズを除去することで高品質な画像を生成します。現在の主流アーキテクチャとして安定した学習が特長です。
選択肢DはVAE(変分オートエンコーダ)の説明であり、潜在空間への圧縮とデコードという仕組みは拡散モデルとは根本的に異なります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →