ある法律事務所が、契約書の審査・要約を自動化するシステムを構築しています。 事務所は以下のデータを保有しています: ・50万件の法律文書(ラベルなし) ・弁護士が作成した契約審査レポートのペアデータ(5,000件) 基盤モデルは一般的な法律用語を理解していますが、事務所独自の審査フォーマットや用語体系には対応していません。 最もコスト効率が高く効果的なカスタマイズ戦略はどれですか?
CPT(継続事前学習)→IFT(指示ファインチューニング)の2段階アプローチが最適です。CPTでラベルなしの大量文書から事務所固有の法律用語・文書構造の深い知識を獲得し、IFTでラベルありペアデータを使い審査タスクのフォーマット・推論スタイルに適応させます。 選択肢Aは、CPTのみでは法律ドメイン知識は強化されますが、審査タスク固有のフォーマットや推論スタイルを学習できず、タスク適応が不完全です。 選択肢Bは、IFTのみでは審査フォーマットへの適応は可能ですが、基盤モデルのドメイン知識不足を補えず、事務所固有の法律用語の理解が不十分になります。 選択肢Cが正解です。CPTでドメイン知識を深め、続けてIFTで審査タスクへ適応する2段階アプローチにより、両課題を効率的に解決できます。 選択肢Dは、RAGは知識検索には有効ですが、事務所独自の審査スタイルや推論パターンの習得には不向きであり、フォーマット一貫性の確保が困難です。