無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

医療系スタートアップが S3 データレイクに患者レコードを保存しています。このデータセットには医療特徴量(診断コード、検査値)と PII(Personally Identifiable Information:個人識別情報)フィールド(氏名、社会保障番号)が混在しています。データサイエンスチームは医療特徴量の列のみ、データガバナンスチームはすべての列にアクセスできるようにする必要があります。最小の運用負荷で列レベルのアクセス制御を実現する方法はどれですか?

A
S3 バケットポリシーで列ごとに異なるプレフィックスにデータを分割し、IAM ポリシーでプレフィックス単位のアクセスを制御する
S3 プレフィックス分割では列単位の制御は不可能です。
B
AWS Lake Formation の列レベルアクセス許可(Column-level permissions)を使用して、データサイエンスチームの IAM ロールに医療特徴量の列のみへのアクセスを付与する
✓ 正解
AWS Lake Formation は列レベル・行レベルのきめ細かいアクセス制御を提供します。IAM ロールに対して特定列のみへのアクセスを許可でき、PII 列を除いた医療特徴量のみをデータサイエンスチームに公開できます。
C
AWS Glue ETL ジョブで PII フィールドを除外したデータセットを別の S3 パスに出力し、データサイエンスチームにそのパスのみへのアクセスを付与する
Glue ETL は重複コピーによるコスト増と管理負荷が生じます。
D
Amazon Macie で PII フィールドを自動検出してオブジェクトタグを付与し、IAM 条件キーでタグベースのアクセス制御を実装する
Amazon Macie はデータ検出・分類ツールであり、アクセス制御機能は持ちません。

解説

選択肢AはS3バケットのプレフィックスを列ごとに分割するアプローチですが、S3は行・オブジェクト単位でのアクセス制御しかできず、同一ファイル内の特定列のみへのアクセス制御は不可能です。 選択肢BのAWS Lake Formationは列レベル・行レベルのきめ細かいアクセス制御を提供します。IAMロールに対して特定列のみへのアクセスを許可でき、PII列を除いた医療特徴量のみをデータサイエンスチームに公開できます。追加のETLやデータコピーが不要で、最小の運用負荷でこの要件を実現できます。 選択肢CのGlue ETLジョブによるPIIフィールド除外データセットの生成は技術的には可能ですが、重複データコピーによるストレージコスト増と、ETLジョブの管理・スケジューリングという運用負荷が生じます。 選択肢DのAmazon MacieはPIIなどの機密データを自動検出・分類するサービスです。アクセス制御機能は持たず、タグを付与してもそれだけではアクセスを制限できないため、要件を満たせません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る