保険会社が Amazon Bedrock Custom Models を使用して保険証券説明文書を生成するモデルをファインチューニングしようとしています。データチームには次の2つのオプションがあります: ・オプション A:自動スクレイピングした 50 万件の保険関連文書(品質がまちまちで、誤り・重複・無関係なコンテンツを多く含む) ・オプション B:手動キュレーションした 5,000 件の高品質な証券説明サンプル(一貫したフォーマット・正確な内容) 最も優れたファインチューニングモデルを生成する可能性が高いのはどちらで、その理由は何ですか?
ファインチューニングの基本原則は「データの質はデータ量に勝る」である。低品質・ノイズの多いデータは誤ったパターンをモデルに学習させ、「Garbage In, Garbage Out(粗悪な入力は粗悪な出力を生む)」という問題を引き起こす。5,000 件の高品質データは 50 万件の低品質データよりも優れたモデルを生成することが多い。