無限ノック › AIP 練習問題一覧 › 問題
AIP実装と統合

ある法律事務所が、契約書の審査・要約を自動化するシステムを構築しています。 事務所は以下のデータを保有しています: ・50万件の法律文書(ラベルなし) ・弁護士が作成した契約審査レポートのペアデータ(5,000件) 基盤モデルは一般的な法律用語を理解していますが、事務所独自の審査フォーマットや用語体系には対応していません。 最もコスト効率が高く効果的なカスタマイズ戦略はどれですか?

A
50万件の法律文書のみを使用して継続事前学習(CPT)を実施し、汎用的な法律知識を習得させる
CPT のみではドメイン知識を習得できても、事務所独自の審査タスク形式への適応ができません。
B
5,000件の審査レポートペアのみを使用して指示ファインチューニング(IFT)を実施し、審査タスクに特化させる
IFT のみでは基盤モデルのドメイン知識不足を補えず、5,000件データでの過学習リスクがあります。
C
まず50万件の文書でCPTを実施してドメイン知識を深め、続けて5,000件のペアデータでIFTを実施して審査タスクへ適応させる
✓ 正解
CPT(50万件文書)でドメイン知識を深め、続けて IFT(5,000件ペア)でタスク適応させることで、事務所独自の法律知識と審査スタイルの両立を実現します。
D
Amazon Bedrock Knowledge BasesとRAGを使用して50万件の文書をベクトルデータベースに格納し、プロンプトエンジニアリングで対応する
RAG は知識検索に有効ですが、事務所独自の審査スタイル・推論パターンの習得には不向きです。

解説

CPT(継続事前学習)→IFT(指示ファインチューニング)の2段階アプローチが最適です。CPTでラベルなしの大量文書から事務所固有の法律用語・文書構造の深い知識を獲得し、IFTでラベルありペアデータを使い審査タスクのフォーマット・推論スタイルに適応させます。 選択肢Aは、CPTのみでは法律ドメイン知識は強化されますが、審査タスク固有のフォーマットや推論スタイルを学習できず、タスク適応が不完全です。 選択肢Bは、IFTのみでは審査フォーマットへの適応は可能ですが、基盤モデルのドメイン知識不足を補えず、事務所固有の法律用語の理解が不十分になります。 選択肢Cが正解です。CPTでドメイン知識を深め、続けてIFTで審査タスクへ適応する2段階アプローチにより、両課題を効率的に解決できます。 選択肢Dは、RAGは知識検索には有効ですが、事務所独自の審査スタイルや推論パターンの習得には不向きであり、フォーマット一貫性の確保が困難です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る