無限ノック › AIF 練習問題一覧 › 問題
AIF生成AIの基礎

ある小売業者が、以下の機能を持つシステムを構築したいと考えています。 ・顧客が商品写真をアップロードするだけで類似商品を提案する ・その画像の内容から自動的に商品説明文を生成する この要件を満たすために最も適切な生成AIモデルの種類はどれですか?

A
テキスト特化型LLM(大規模言語モデル) — テキストのみを入力として受け付け、テキストを生成するモデル
「テキスト特化型LLM」は、テキストのみを入力として処理するため、商品写真という画像入力を扱えず要件を満たせません。
B
マルチモーダル基盤モデル — 画像・テキスト・音声など複数のデータ形式(モダリティ)を統合的に入力として処理できるモデル
✓ 正解
マルチモーダル基盤モデルは、画像・テキスト・音声など複数の異なるデータ形式(モダリティ)を統合的に理解・処理できるモデルです。商品画像を理解して類似商品を提案(画像理解)し、その画像から説明文を生成(テキスト生成)するにはマルチモーダル能力が必須です。
C
拡散モデル(Diffusion Model) — ガウスノイズからの逆拡散プロセスによって新規の高品質画像を生成するモデル
「拡散モデル」は、ガウスノイズから逆拡散プロセスを経て新規画像を生成するモデルであり、既存画像の内容理解や説明文生成には適しません。
D
強化学習モデル — 環境からの報酬シグナルに基づいて最適な行動方策を繰り返し学習するモデル
「強化学習モデル」は、環境からの報酬シグナルに基づく行動最適化に特化したアーキテクチャであり、画像理解・テキスト生成といったコンテンツ処理タスクには本質的に適していません。

解説

選択肢Aは、テキストのみを入力として処理するため、商品写真という画像入力を扱えず、類似商品提案・説明文生成の要件を満たせません。 選択肢Bは、画像・テキスト・音声など複数の異なるデータ形式(モダリティ)を統合的に理解・処理できるモデルです。商品画像を理解して類似商品を提案(画像理解)し、その画像から説明文を生成(テキスト生成)するにはマルチモーダル能力が必須であり、この要件に最適です。 選択肢Cは、ガウスノイズから逆拡散プロセスを経て新規画像を生成するモデルであり、既存画像の内容理解や説明文生成には適していません。 選択肢Dは、環境からの報酬シグナルに基づく行動最適化に特化したアーキテクチャであり、画像理解・テキスト生成といったコンテンツ処理タスクには本質的に適していません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIF の問題一覧に戻る