あるデータ分析チームは、毎日数TBのCSVファイルをS3に保存し、Amazon AthenaでSQLクエリを実行しています。 クエリのパフォーマンスを改善しコストを削減するために、最も効果的なファイル形式とS3の構成変更はどれですか?
Apache Parquetはカラム型圧縮フォーマットで、Athenaが特定の列だけを読み込む際のスキャン量を大幅に削減できます。S3プレフィックスによるパーティション分割(例:year=/month=/day=)によりクエリ条件に合致するパーティションのみスキャンされ、パフォーマンスとコストが改善されます。AthenaはスキャンデータのGB単位で課金されるため、スキャン削減は直接コスト削減につながります。 選択肢AはCSVをまとめても列指向アクセスの最適化は得られません。 選択肢CはRDSへのインポートは分析用途に不向きで管理コストが増します。 選択肢DはTransfer AccelerationはS3への転送速度の改善であり、クエリパフォーマンスとは関係ありません。