DEAデータの取り込みと変換

データエンジニアチームはS3に毎時追加される新しいログファイルをGlue ETLジョブで処理している。ジョブが再実行されると既処理ファイルも再度読み込まれて出力に重複データが発生している。追加のインフラ実装を最小化して解決するにはどれか。

A
S3イベント通知でLambdaをトリガーし、新着ファイルをDynamoDB テーブルに記録してGlueジョブで参照する
Lambda とDynamoDB による追跡は動作するが、テーブル設計・Lambda実装・Glueとの連携ロジックが必要で追加実装コストが高い。
B
Amazon EventBridge とStep Functions を組み合わせ、新着ファイルリストを状態マシンで管理してGlueジョブへ渡す
Amazon EventBridge とStep Functions による状態管理は複雑なワークフロー向けであり、単純な増分読み込みにはオーバーエンジニアリングとなる。
C
Glue ジョブのジョブブックマーク機能を有効化し、前回実行時の処理済みS3オブジェクトを自動スキップして増分処理する
✓ 正解
AWS Glue ジョブブックマークはGlue組み込みの増分処理機能で、設定1つで前回実行以降の新規S3オブジェクトのみを自動選択し重複を防ぐ。
D
Glue ジョブ内でS3の最終更新日時メタデータを取得し、直近1時間以内のファイルのみをフィルタリングして処理する
Glue ジョブ内でのタイムスタンプフィルタリングはジョブ実行遅延や時刻ずれで未処理・重複が生じるリスクがあり、信頼性の高い増分処理には不向き。

解説

AWS Glue ジョブブックマークは前回実行時の処理済みS3オブジェクトを自動追跡し、次回実行時に未処理データのみを読み込む組み込み機能。追加インフラ不要で増分処理を実現する。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
DEA の問題一覧に戻る