AIF生成AIの基礎
あるゲーム会社が、テキストによるキャラクター説明文(例:「炎の翼を持つドラゴン、赤と金の配色」)から高品質なキャラクター画像を自動生成するパイプラインを構築したいと考えています。このテキスト→画像生成(Text-to-Image)タスクに最も適した生成AIモデルのアーキテクチャはどれですか?
A大規模言語モデル(LLM: Large Language Model)
大規模言語モデル(LLM)はGPTやClaudeに代表されるテキスト生成・要約・翻訳などの自然言語処理に特化したアーキテクチャです。テキストから画像を直接生成することはできず、画像生成タスクには適していません。
B拡散モデル(Diffusion Model)
✓ 正解
ランダムノイズを段階的に除去するプロセスを学習し、テキストプロンプトを条件として高品質な画像を生成します。Stable DiffusionやDALL-Eがその代表例であり、テキスト→画像変換に最も適したアーキテクチャです。
C再帰型ニューラルネットワーク(RNN: Recurrent Neural Network)
再帰型ニューラルネットワーク(RNN)は時系列データや自然言語などの系列データ処理に使われる旧来のアーキテクチャです。画像生成の用途には適しておらず、近年は多くのタスクでTransformerに置き換えられています。
D勾配ブースティング決定木(GBDT: Gradient Boosted Decision Tree)
勾配ブースティング決定木(GBDT)はXGBoostやLightGBMに代表される分類・回帰向けの教師あり機械学習手法です。構造化データの予測タスクには有効ですが、テキストから画像を生成するタスクには使用しません。
解説
拡散モデル(Diffusion Model)は、画像にランダムノイズを段階的に加えるプロセスを学習し、逆にノイズから徐々に画像を復元することで高品質な画像を生成します。Stable DiffusionやDALL-Eなどがその代表例で、テキスト条件付き画像生成に特化しています。
選択肢Aの大規模言語モデル(LLM)はGPTやClaudeに代表されるテキスト生成・要約・翻訳などの自然言語処理に特化したアーキテクチャであり、テキストから直接画像を生成することはできません。
選択肢Cの再帰型ニューラルネットワーク(RNN)は時系列データや自然言語などの系列データ処理に使われる旧来のアーキテクチャです。画像生成には適しておらず、近年は多くのタスクでTransformerに置き換えられています。
選択肢Dの勾配ブースティング決定木(GBDT)はXGBoostやLightGBMに代表される分類・回帰向けの教師あり機械学習手法です。構造化データの予測に強みを持ちますが、テキストから画像を生成するタスクには使用しません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →