無限ノック › DEA 練習問題一覧 › 問題
DEAデータの取り込みと変換

あるデータエンジニアリングチームは、毎日S3バケットに追加される新しいCSVファイルをAWS Glueジョブで処理しています。現在のジョブは実行のたびにS3バケット内の全ファイルを再処理してしまい、処理時間とコストが増大しています。既に処理済みのファイルをスキップし、新規追加ファイルのみを処理するよう変更する場合、最も適切な方法はどれですか?

A
Glueジョブのパラメータに '--job-bookmark-option job-bookmark-enable' を追加し、ジョブブックマーク機能を有効にする
✓ 正解
が正解です。'--job-bookmark-option job-bookmark-enable' パラメータを指定するだけで有効化でき、AWS側が処理状態を管理するため運用コストも低いです。
B
S3 Event NotificationとAWS Lambdaを組み合わせ、新しいファイルが追加されたときにのみGlueジョブを起動するようにする
誤りです。S3 Event Notificationによるトリガーはジョブの起動契機を制御しますが、ジョブ内部での増分処理ロジックを提供するものではなく、再処理の防止にはなりません。
C
Glueジョブのスクリプトにカスタムロジックを実装し、処理済みファイルのリストをAmazon DynamoDBに記録・参照する
誤りです。DynamoDBを使ったカスタム実装は機能しますが、実装・保守コストが高く、ジョブブックマークで同等の目的を簡単に達成できるため最適ではありません。
D
AWS Glue Crawlerを毎日実行してGlue Data Catalogを更新し、新規パーティションのみをジョブの入力として使用する
誤りです。Glue Crawlerは新しいテーブルやパーティションをData Catalogに登録する機能であり、ジョブ単位の増分処理制御はできません。

解説

正解: Glueジョブのパラメータに '--job-bookmark-option job-bookmark-enable' を追加し、ジョブブックマーク機能を有効にする。 AWS Glueのジョブブックマーク(Job Bookmark)は、前回の実行で処理済みのデータを自動追跡し、次回実行時に未処理データのみを対象とするAWSマネージドの増分処理機能です。S3ファイルや各種データソースに対応しており、追加実装なしに重複処理を防止できます。 選択肢Aが正解です。'--job-bookmark-option job-bookmark-enable' パラメータを指定するだけで有効化でき、AWS側が処理状態を管理するため運用コストも低いです。 選択肢Bは誤りです。S3 Event Notificationによるトリガーはジョブの起動契機を制御しますが、ジョブ内部での増分処理ロジックを提供するものではなく、再処理の防止にはなりません。 選択肢Cは誤りです。DynamoDBを使ったカスタム実装は機能しますが、実装・保守コストが高く、ジョブブックマークで同等の目的を簡単に達成できるため最適ではありません。 選択肢Dは誤りです。Glue Crawlerは新しいテーブルやパーティションをData Catalogに登録する機能であり、ジョブ単位の増分処理制御はできません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る