広告テクノロジー企業が、1日あたり100億件のクリックイベントログをS3に蓄積し、機械学習モデルのトレーニングと分析に活用しています。各イベントには50フィールドが含まれますが、各トレーニングジョブでは平均8〜12フィールドのみ使用します。Amazon AthenaでのアドホッククエリとAWS Glue ETLによるバッチ変換、SageMakerトレーニングジョブの3つのユースケースで同一ファイルを共有する予定です。ストレージコストを削減しながら列選択アクセスを効率化するには、どのファイルフォーマットが最適ですか?
Apache Parquetは列指向フォーマットで使用するカラムのみを読み込む列プルーニングをサポートし、Snappy圧縮によるストレージ削減とAthena・Glue・SageMakerのネイティブ対応により3ユースケース共有に最適。