無限ノック › AIP 練習問題一覧 › 問題
AIPテスト、検証、トラブルシューティング

コンテンツマーケティング企業が、Amazon Bedrock(Claude)を使ってブログ記事の下書きを自動生成しています。新しいブランドガイドラインを反映してシステムプロンプトを更新しており、10カテゴリにわたるコンテンツ全体で品質が向上し、かつ既存エッジケースで出力が退行していないことを体系的に検証したいと考えています。人間の編集者が承認した200件の参照プロンプト・レスポンスペアが利用可能です。更新後のシステムプロンプトを検証する最も効率的なアプローチはどれですか。

A
Amazon Bedrock Prompt Managementで新旧両バージョンのシステムプロンプトをバージョン管理し、Bedrock Model Evaluationで200件の参照データをground truthとして使用しROUGEとBERTScoreで両バージョンを定量比較する
✓ 正解
Bedrock Prompt ManagementとBedrock Model Evaluationを組み合わせることで、プロンプトバージョン管理から定量評価まで一連のワークフローをBedrockネイティブのサービスで完結できる。200件のground truthを使ったROUGE・BERTScoreによる自動比較は、体系的なプロンプト回帰テストに最も効率的なアプローチである。
B
AWS Step Functionsステートマシンを構築して200件の参照プロンプト全件に両バージョンのシステムプロンプトを適用し、レスポンスをS3に保存してLambdaでコサイン類似度スコアを計算するパイプラインを実装する
Step Functions + Lambdaで同等の機能を実装することは技術的に可能だが、Bedrockのマネージドサービスで提供される機能を自前実装するため、開発工数・テスト・運用コストが大幅に増加する。既存のBedrockサービスを活用するより効率が大きく劣る。
C
Bedrock Playgroundのバッチ比較機能を使用して200件の参照プロンプトに両バージョンのシステムプロンプトを並列実行し、コンソール上でカテゴリ別に出力品質をインタラクティブに確認する
Bedrock Playgroundにはバッチ比較機能は存在しない。Playgroundはインタラクティブな少数サンプルのテスト用ツールであり、200件の体系的な自動回帰テストには対応できない。
D
Amazon SageMaker Processing jobでBedrock APIを呼び出して両バージョンの出力を一括生成し、HuggingFaceライブラリでBERTScoreを計算してSageMaker Experimentsで結果を管理する
SageMaker Processing jobによるアプローチはMLモデルの大規模バッチ評価には有効だが、Bedrock Prompt ManagementとModel Evaluationというマネージドサービスで実現できるプロンプト評価タスクに対して過剰なインフラ構成であり、効率的でない。

解説

Amazon Bedrock Prompt Managementはプロンプトのバージョン管理・デプロイを一元管理できるサービスで、Bedrock Model Evaluationと統合することで体系的なプロンプト回帰テストが可能になる。200件の編集者承認済み参照データをground truthとしてアップロードし、ROUGE・BERTScoreで両バージョンを自動比較することで、カテゴリ別の品質改善と退行を定量的に検証できる。Bedrockネイティブのサービスのみで完結し、追加インフラの構築が最小限で済む最も効率的な手法である。 選択肢BのStep Functions + Lambdaによるカスタムパイプラインは機能するが、Bedrockのマネージドサービスで実現できる機能を自前実装することになり、開発・テスト・運用コストが大幅に増加する。 選択肢CのBedrock Playgroundにはバッチ比較機能が存在せず、200件の評価をインタラクティブコンソールで処理することは実用的でない。 選択肢DのSageMaker Processing jobによるアプローチはBedrockネイティブの評価サービスを使わず、プロンプト評価という目的に対して不必要に複雑なインフラ構成になる。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る