あるログ分析チームは1日500GBのアプリケーションログをS3にフラット構造(プレフィックスなし)で保存し、Amazon Athenaでアドホッククエリを実行している。過去1週間のデータのみを対象とするクエリでも全量スキャンが発生してコストが高騰している。データ構造を整理してスキャン量を最大限削減する最も効果的な方法は?
Parquet変換と日付パーティション分割の組み合わせが最も効果的。WHERE句でパーティションキーを指定することで対象ファイルのみスキャンされ、列指向フォーマットで必要列のみ読み取られコストが大幅に削減される。