Amazon Nova Pro:Nova ファミリー最高の視覚的理解能力と長いコンテキストウィンドウを持つが、シンプルなランドマーク識別では能力過剰となりコストがNova Liteより大幅に高く、大量処理でのコスト最小化要件に反する
Nova ProはNovaファミリーで最高の視覚的理解能力を持ちますが、単純なランドマーク識別タスクには能力過剰です。Nova Liteと比較してコストが高くなるため、80,000枚/日の大量処理でコスト最小化を優先する要件に合致しません。
解説
Amazon Nova Lite は Amazon Nova ファミリーの中でコストと速度を優先したマルチモーダルモデルです。テキスト・画像・動画の入力に対応し、構造化されたJSON出力を含むテキスト生成が可能です。Nova Pro と比較して処理コストが大幅に低く、ランドマーク識別のような高度な推論を要しないタスクでは精度面でも十分な性能を発揮します。80,000枚/日という大量処理ではコスト差が顕著に現れるため、コスト最小化要件に最も適合します。
選択肢BのClaude 3.5 Sonnetは高精度な画像理解能力を持ちますが、入力/出力トークンあたりのコストがNova Liteより高く、シンプルなランドマーク識別には過剰スペックです。コスト最小化が最優先の本ケースでは最適ではありません。
選択肢CのAmazon Titan Multimodal Embeddings G1は、画像とテキストの埋め込みベクターを生成する埋め込みモデルです。テキスト生成機能を持たないため、旅行パッケージをJSON形式で出力する要件を満たすことができず、このユースケースには不適です。
選択肢DのAmazon Nova Proは複雑な視覚推論が必要なタスク向けの高性能モデルです。シンプルなランドマーク識別ではオーバースペックとなり、Nova Liteと比較してコストが高くなるため、大量処理でのコスト最小化要件に合いません。