SAA高性能なアーキテクチャの設計

あるデータ分析チームは、毎日数TBのCSVファイルをS3に保存し、Amazon AthenaでSQLクエリを実行しています。 クエリのパフォーマンスを改善しコストを削減するために、最も効果的なファイル形式とS3の構成変更はどれですか?

A
CSVファイルをより大きなファイルサイズに結合し、S3 Standardに保存する
CSVをまとめても列指向アクセスの最適化は得られません。
B
データをApache Parquet形式に変換し、クエリの条件に合わせてS3プレフィックスでパーティション分割する
✓ 正解
Apache Parquetはカラム型圧縮フォーマットで、Athenaが特定の列だけを読み込む際のスキャン量を大幅に削減できます。S3プレフィックスによるパーティション分割(例:year=/month=/day=)によりクエリ条件に合致するパーティションのみスキャンされ、パフォーマンスとコストが改善されます。AthenaはスキャンデータのGB単位で課金されるため、スキャン削減は直接コスト削減につながります。
C
CSVデータをRDS for PostgreSQLにインポートしてAthenaと連携させる
RDSへのインポートは分析用途に不向きで管理コストが増します。
D
S3バケットでTransfer Accelerationを有効化して転送速度を改善する
Transfer AccelerationはS3への転送速度の改善であり、クエリパフォーマンスとは関係ありません。

解説

Apache Parquetはカラム型圧縮フォーマットで、Athenaが特定の列だけを読み込む際のスキャン量を大幅に削減できます。S3プレフィックスによるパーティション分割(例:year=/month=/day=)によりクエリ条件に合致するパーティションのみスキャンされ、パフォーマンスとコストが改善されます。AthenaはスキャンデータのGB単位で課金されるため、スキャン削減は直接コスト削減につながります。 選択肢AはCSVをまとめても列指向アクセスの最適化は得られません。 選択肢CはRDSへのインポートは分析用途に不向きで管理コストが増します。 選択肢DはTransfer AccelerationはS3への転送速度の改善であり、クエリパフォーマンスとは関係ありません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでSAAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
SAA の問題一覧に戻る