DEAデータオペレーションとサポート
あるデータエンジニアリングチームは、外部システムから毎日Amazon S3に配信されるCSVファイルをAWS Glue Crawlerでカタログ化しています。
ソースシステムは不定期に新しい列を追加することがあります。
チームは既存のAmazon Athenaクエリを壊すことなく、AWS Glue Data Catalogを常に最新の状態に保ちたいと考えています。
最も適切なCrawlerの設定はどれですか?
ACrawlerのスキーマ変更ポリシーを「テーブル定義を更新する(Update the table definition in the Data Catalog)」に設定する
「テーブル定義を更新する」は全スキーマ変更を適用するため、列削除・型変更時に既存クエリが破損するリスクがあります。
BCrawlerのスキーマ変更ポリシーを「新しい列のみを追加する(Add new columns only)」に設定する
✓ 正解
「新しい列のみを追加する」ポリシーは既存の列定義を変更せず追加列のみData Catalogに反映するため、既存のAthenaクエリへの影響を防げます。
CAWS Glue Schema Registryを設定し、スキーマ互換性モードをBACKWARD_TRANSITIVEにする
Schema Registryはストリーミングデータのスキーマ管理(KinesisやKafka)に使用し、CrawlerのData Catalog更新ポリシーとは別機能です。
DCrawlerのスキーマ変更ポリシーを「変更を無視する(Ignore the change)」に設定し、変更は手動で適用する
「変更を無視する」設定では自動更新が行われず、継続的な手動作業が必要になります。
解説
「新しい列のみを追加する」ポリシーは既存の列定義を変更せず追加列のみData Catalogに反映するため、既存のAthenaクエリへの影響を防げます。
選択肢Aの「テーブル定義を更新する」は全スキーマ変更を適用するため、列削除・型変更時に既存クエリが破損するリスクがあります。
選択肢CのSchema Registryはストリーミングデータのスキーマ管理(KinesisやKafka)に使用し、CrawlerのData Catalog更新ポリシーとは別機能です。
選択肢Dの「変更を無視する」設定では自動更新が行われず、継続的な手動作業が必要になります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →