エンタープライズ企業がAmazon Bedrock Knowledge Bases を使用した社内ITサポート向けRAG(Retrieval-Augmented Generation:検索拡張生成)システムを構築しました。本番リリース前に検索品質と生成品質の両方を包括的に評価したいと考えています。RAGシステムの総合評価として最も適切なアプローチはどれですか?
RAGシステムは検索フェーズと生成フェーズを分けて評価することが重要です。Context Precision(取得コンテキストの正確さ)とContext Recall(必要コンテキストの網羅性)で検索品質を、Faithfulness(ハルシネーション検出)とAnswer Relevancy(質問との関連性)で生成品質を測定します。これらはRAGAS等のRAG評価フレームワークで標準的に使用されるメトリクスです。 選択肢AのBLEUやROUGEは参照テキストとの文字列一致度を測る指標であり、同じ意味でも表現が異なれば低スコアになるため多様な正解表現を持つRAGの評価には適しません。また検索フェーズの品質も評価できません。 選択肢BのCloudWatchメトリクスはインフラの安定性・可用性を測定するものであり、RAGの検索精度や生成品質(ハルシネーション率)を直接評価できません。システムが安定稼働していても回答の質が低い場合があります。 選択肢Dのユーザーフィードバックは本番運用後に蓄積されるため、本番リリース前の事前品質評価には使用できません。単純なサムズアップ/ダウンでは検索・生成各フェーズの具体的な問題点を特定することが困難です。