あるeコマース企業が、Amazon Bedrock Custom Modelsを使ってAmazon Titan Text G1を自社の商品カタログ・レビューデータ50万件でファインチューニングしました。このモデルを本番デプロイする前に、ベースモデルと比べてタスク固有のパフォーマンスが向上しているかどうかを客観的に検証する必要があります。最も適切な評価アプローチはどれですか?
ファインチューニング済みモデルの評価では、トレーニングデータとは独立したホールドアウトテストセットを使用することが原則です。Bedrock Model Evaluationは複数モデルの比較評価をサポートしており、同一テストセットに対してファインチューニング済みモデルとベースモデルの両方でROUGE(テキスト一致度)・BERTScore(意味的類似度)を算出し、客観的なスコア比較が可能です。これによりファインチューニングによる改善効果とリグレッションを定量的に把握した上でデプロイ判断を下せます。 選択肢Aのトレーニングデータを使ったパープレキシティ評価はデータリークの問題があり、モデルが訓練データを記憶しているだけで汎化性能を正しく測定できません。 選択肢Cのアプローチは事前品質検証なしに本番ユーザーにリスクをさらし、品質問題が発生した場合の影響範囲が大きくなります。 選択肢Dのトレーニング損失の収束確認はモデルが訓練データを学習できたことを示しますが、タスク固有の品質向上やベースモデルとの比較を保証しません。