AIPテスト、検証、トラブルシューティング

通信会社がAmazon Bedrockでカスタマーサポート向けに指示ファインチューニングしたモデルを本番デプロイする前に品質評価を実施します。評価項目は「回答の正確さ」「回答の流暢さ」「企業ポリシーへの準拠」の3軸です。最も包括的かつ実用的な評価アプローチはどれか。

A
Amazon Bedrock Model EvaluationでROUGEスコア(ROUGE: Recall-Oriented Understudy for Gisting Evaluation、テキスト要約の自動評価指標)のみを使用して自動評価を実施し、閾値を超えればデプロイ承認とする
ROUGE単体では企業ポリシー準拠を測定できません。
B
ファインチューニング済みモデルをProvisioned Throughputに即時デプロイし、実ユーザーへのA/Bテストで本番トラフィックを使って品質を評価する
A/Bテストはデプロイ後の比較手法であり、デプロイ前評価には不適切です。
C
Bedrock Model Evaluationで自動メトリクス(ROUGE・BERTScoreなど)による定量評価を実施しつつ、カスタマーサポート部門の専門担当者によるヒューマンエバリュエーション(人間評価)を組み合わせて多角的に評価する
✓ 正解
カスタマーサポート用途の品質評価には、定量・定性の両側面が必要です。ROUGE(参照テキストとの単語重複率)やBERTScore(事前学習モデルを用いた意味的類似性スコア)などの自動メトリクスは客観的な正確さを測定できますが、流暢さ・共感性・企業ポリシー準拠などの主観的品質はドメイン専門家のヒューマンエバリュエーションが不可欠です。
D
ファインチューニング前後のモデルに同一プロンプトを投入し、出力テキストのトークン数と応答速度の差分のみを比較して品質向上を確認する
テキスト長や応答速度は品質の代理指標にはなりません。

解説

カスタマーサポート用途の品質評価には、定量・定性の両側面が必要です。ROUGE(参照テキストとの単語重複率)やBERTScore(事前学習モデルを用いた意味的類似性スコア)などの自動メトリクスは客観的な正確さを測定できますが、流暢さ・共感性・企業ポリシー準拠などの主観的品質はドメイン専門家のヒューマンエバリュエーションが不可欠です。 選択肢A:ROUGE単体では企業ポリシー準拠を測定できません。 選択肢B:A/Bテストはデプロイ後の比較手法であり、デプロイ前評価には不適切です。 選択肢D:テキスト長や応答速度は品質の代理指標にはなりません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIP の問題一覧に戻る