AIFAIソリューションのセキュリティ、コンプライアンス、ガバナンス
複数の医療機関が連携してがん検出AIモデルを共同開発しようとしています。各病院は患者の医療画像データを保有していますが、HIPAAなどのプライバシー規制および各病院のポリシーにより、生の患者データを院外に持ち出したり中央のリポジトリに集約することは一切できません。生の患者データを共有せずに各施設のデータを活用してモデルを継続的に改善できる機械学習アプローチはどれですか?
A各病院が事前学習済みモデルを独自にファインチューニングし、最も評価指標が高かった病院のモデルをグローバルモデルとして全施設に配布する転移学習
転移学習は事前学習済みモデルをローカルでファインチューニングする手法ですが、複数施設が継続的に協調してモデルを改善する仕組みではなく、1施設のモデルを採用するだけでは他施設のデータを活用できません。
B各病院のデータに統計的ノイズを加えて個人を特定できなくした上で中央サーバーに送信し、プライバシーを保護した状態で集中学習を行う差分プライバシー
差分プライバシーはデータにノイズを加えて個人識別を困難にする技術ですが、ノイズを付加したデータでも院外への送信自体が規制対象となりうるため、「データを一切院外に持ち出せない」という要件を完全には満たせません。
C各施設でローカルにモデルを学習し、生データではなくモデルのパラメータ更新のみを集約サーバーに送信して統合するFederated Learning(連合学習)
✓ 正解
Federated Learningは生データを共有せず、各施設でローカルに学習したモデルのパラメータ更新のみを集約・統合するため、院外へのデータ持ち出しを一切せずに全施設のデータを活かしたモデル改善が実現できます。
D敵対的生成ネットワーク(GAN)を使用して各病院が実データに近い合成医療画像を生成し、その合成データのみを中央リポジトリに送信してモデルを学習する
GANによる合成データ生成は実データに似た画像を作成できますが、その合成データを中央リポジトリに送信すること自体が各病院の院外データ持ち出し禁止ポリシーや規制に違反する可能性があります。
解説
Federated Learning(連合学習)は、生データを一切共有せずに複数の施設が協調してモデルを改善できる分散機械学習アプローチです。動作の仕組みは以下の通りです。
①各病院がローカルデータでモデルを学習し、パラメータ(重み)の更新値のみを集約サーバーに送信する
②集約サーバーが各施設からの更新をFedAvgなどのアルゴリズムで統合し、グローバルモデルを更新する
③更新されたグローバルモデルを各病院に配布して次のラウンドを繰り返す
生データは院外に出ないためHIPAA等のプライバシー規制に対応でき、医療・金融・IoTデバイスなどのドメインで広く活用されています。
選択肢Aの転移学習は事前学習モデルをローカルでファインチューニングする手法ですが、1施設のモデルを採用するだけでは他施設のデータを継続的に活かす仕組みにならず、複数施設の協調改善には対応できません。
選択肢Bの差分プライバシーはデータにノイズを加えて個人識別を困難にする技術ですが、ノイズを付加したデータであっても院外への送信自体が規制対象となる可能性があり、「データを院外に持ち出せない」という要件を完全には満たせません。
選択肢DのGANによる合成データ生成は実データに似た画像を生成できますが、その合成データを中央リポジトリに送信すること自体が院外送信の禁止ポリシーに違反する可能性があります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →