ある通信企業がAmazon Bedrock Knowledge BasesとClaude 3 Sonnetを使った社内技術サポートQAシステムを開発しています。本番リリース前に以下の2点を定量的に評価する必要があります。 ・「生成された回答がソース文書に忠実か(Faithfulness)」 ・「検索されたドキュメントがクエリと関連しているか(Retrieval Precision)」 評価データセット5,000件に対してコスト効率よく自動評価を実施する方法として最も適切なものはどれですか?
Amazon Bedrock Model Evaluationは、RAGパイプラインの品質を定量的に評価するためのマネージドサービスです。LLM-as-a-judge評価タイプを使用すると、指定したジャッジモデル(例:Claude)が各レスポンスについてFaithfulness(生成テキストがソース文書に根拠を持つか)やRetrieval Precision(検索チャンクがクエリと関連するか)などのナレッジベース固有の指標を自動スコアリングします。評価ジョブはマネージドインフラ上で実行されるため、5,000件規模でも追加インフラの管理なしにコスト効率よく実施でき、結果はS3とコンソールで確認できます。 選択肢AのSageMaker Ground Truthによる人間評価は品質は高いものの、5,000件を専門家チームが手動採点するコストと時間は自動評価と比較して著しく大きく、コスト効率の要件を満たしません。 選択肢CのROUGE-L・BERTScoreはテキストの表層的な類似度を測定する指標であり、Faithfulnessのような事実的な整合性やRetrieval Precisionのような意味論的な関連性を正確に評価することはできません。 選択肢Dの評価専用ファインチューニングは、評価モデルの訓練コストと期間が膨大であり、同等機能をマネージドで提供するBedrock Model Evaluationと比較して非効率です。