無限ノック › AIP 練習問題一覧 › 問題
AIP実装と統合

保険会社が Amazon Bedrock Custom Models を使用して保険証券説明文書を生成するモデルをファインチューニングしようとしています。データチームには次の2つのオプションがあります: ・オプション A:自動スクレイピングした 50 万件の保険関連文書(品質がまちまちで、誤り・重複・無関係なコンテンツを多く含む) ・オプション B:手動キュレーションした 5,000 件の高品質な証券説明サンプル(一貫したフォーマット・正確な内容) 最も優れたファインチューニングモデルを生成する可能性が高いのはどちらで、その理由は何ですか?

A
オプション A(50 万件)を選択すべきである。ファインチューニングはビッグデータアプローチであり、データ量が多いほど常に性能が向上するため
ファインチューニングではデータ量よりもデータの品質・一貫性が重要です。低品質・ノイズの多いデータはモデルに誤りや不適切なパターンを学習させ、本番品質を低下させます。
B
オプション B(5,000 件)を選択すべきである。ファインチューニングではデータの品質・一貫性がデータ量よりも重要であり、低品質データはモデルに誤りや不適切なパターンを学習させ本番品質を低下させるため
✓ 正解
ファインチューニングの基本原則は「データの質がデータ量に勝る」です。5,000件の高品質データは50万件の低品質データよりも優れたモデル性能を生成することが多く、「Garbage In, Garbage Out」問題を回避できます。
C
オプション A と B を結合して 50 万 5,000 件すべてを使用し、データの多様性を最大化すべきである
低品質データを混ぜることはモデルに誤りパターンを学習させ、かえって本番品質を低下させます。データの多様性よりも品質・一貫性を優先すべきです。
D
どちらのオプションも不十分であり、少なくとも 100 万件の高品質データがなければ意味のあるファインチューニング効果は得られない
高品質データであれば5,000件で有意なファインチューニング効果が得られます。むしろ低品質データ100万件よりも高品質5,000件の方が優れたモデルを生成します。

解説

ファインチューニングの基本原則は「データの質はデータ量に勝る」である。低品質・ノイズの多いデータは誤ったパターンをモデルに学習させ、「Garbage In, Garbage Out(粗悪な入力は粗悪な出力を生む)」という問題を引き起こす。5,000 件の高品質データは 50 万件の低品質データよりも優れたモデルを生成することが多い。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る