AIF生成AIの基礎
電力会社が設備点検レポート(1件あたり平均80〜100ページ)をAmazon Bedrockで一括処理して要約するシステムを設計しています。単一の基盤モデル呼び出しで全文書を処理しようとする場合、最も考慮すべきLLMの技術的特性はどれですか?
ALLMはPDFを直接解析できないため、テキスト抽出ツールによる前処理パイプラインが必ず必要になる
PDFの前処理が必要なケースはありますが、Amazon BedrockのClaude等はPDFを直接処理できます。100ページの文書を1回の呼び出しで処理する場合の主な制約はコンテキストウィンドウです。
BLLMはトレーニングカットオフ以降の法改正情報を持たないため、最新規制に基づく判断には追加データが必要になる
トレーニングカットオフは最新情報への対応の問題であり、長大な文書を単一呼び出しで処理できるかという設計上の主な制約とは別の技術的特性です。
CLLMには一度に処理できるテキスト量(コンテキストウィンドウ)に上限があり、超過テキストは処理対象外になる
✓ 正解
コンテキストウィンドウはLLMが1回の推論で処理できるトークン数の上限であり、100ページの文書がこれを超える場合は文書分割(チャンキング)や長コンテキストモデルの選択が必要です。
DLLMは日本語より英語の処理精度が高いため、日本語文書では翻訳による前処理が推奨される
現代の主要なLLMは多言語に対応しており、日本語文書で必ず英語翻訳が必要とはいえません。長文書処理の主たる制約はコンテキストウィンドウの上限です。
解説
大規模言語モデル(LLM)は「コンテキストウィンドウ」と呼ばれる、1回の推論で処理できるトークン数の上限を持っています。80〜100ページの設備点検レポートがこの上限を超える場合、文書を複数チャンクに分割して処理するか、長いコンテキストウィンドウを持つモデルを選択するなどの設計が必要です。
コンテキストウィンドウの制約は、RAGのチャンク設計・バッチ処理戦略・基盤モデルの選定において重要な考慮事項です。モデルによってサイズは数千トークンから数百万トークン対応のものまで存在します。
選択肢AのPDF直接解析の制限はフォーマットの問題であり、Amazon BedrockのClaude等はPDFを直接処理できるため必ずしも前処理が必要ではありません。
選択肢Bのトレーニングカットオフはリアルタイムデータへの対応の問題であり、長大な文書を1回の呼び出しで処理できるかという問題とは別の制約です。
選択肢Dの日本語処理精度は現代の主要LLMでは大きな問題ではなく、長文書処理の主たる制約とはいえません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →