医療系スタートアップが S3 データレイクに患者レコードを保存しています。このデータセットには医療特徴量(診断コード、検査値)と PII(Personally Identifiable Information:個人識別情報)フィールド(氏名、社会保障番号)が混在しています。データサイエンスチームは医療特徴量の列のみ、データガバナンスチームはすべての列にアクセスできるようにする必要があります。最小の運用負荷で列レベルのアクセス制御を実現する方法はどれですか?
選択肢AはS3バケットのプレフィックスを列ごとに分割するアプローチですが、S3は行・オブジェクト単位でのアクセス制御しかできず、同一ファイル内の特定列のみへのアクセス制御は不可能です。 選択肢BのAWS Lake Formationは列レベル・行レベルのきめ細かいアクセス制御を提供します。IAMロールに対して特定列のみへのアクセスを許可でき、PII列を除いた医療特徴量のみをデータサイエンスチームに公開できます。追加のETLやデータコピーが不要で、最小の運用負荷でこの要件を実現できます。 選択肢CのGlue ETLジョブによるPIIフィールド除外データセットの生成は技術的には可能ですが、重複データコピーによるストレージコスト増と、ETLジョブの管理・スケジューリングという運用負荷が生じます。 選択肢DのAmazon MacieはPIIなどの機密データを自動検出・分類するサービスです。アクセス制御機能は持たず、タグを付与してもそれだけではアクセスを制限できないため、要件を満たせません。