MLA機械学習のためのデータ準備
あるMLチームは、S3データレイクに蓄積された数TBのParquet形式のイベントログから、SQLによる集計や結合で特徴量を生成しようとしています。利用は不定期かつアドホックで、クラスター管理を避けてスキャンしたデータ量に応じた課金で済ませたいと考えています。インフラ運用の負担を最小化できる方法はどれですか。
AAmazon Athena でS3上のParquetを直接クエリし、サーバーレスでアドホックなSQL集計を実行する
✓ 正解
Athena は S3 上の Parquet を直接クエリできるサーバーレスサービスで、クラスター管理不要かつスキャンデータ量に応じた従量課金のため、不定期なアドホック集計の運用負担とコストを最小化できる。列指向フォーマットでスキャン量も削減できる。
BAmazon EMR で常時稼働のSparkクラスターを構築し、対話的に集計ジョブを実行する
EMR の常時稼働クラスターはアイドル時もコストが発生し、クラスターの構築・スケーリング・パッチ適用などの運用負担が大きい。不定期利用ではリソースが無駄になり、運用最小化の要件に反する。
Cデータを Amazon Redshift のプロビジョンドクラスターにロードしてからSQLで集計する
Redshift プロビジョンドクラスターは事前のデータロードとクラスター運用が必要で、アドホックで不定期な用途にはオーバースペック。常時起動分のコストも発生し運用負担最小化に適さない。
DParquetを Amazon RDS for PostgreSQL にインポートし、SQLで特徴量を生成する
RDS for PostgreSQL は OLTP 向けの行指向データベースであり、TB規模の分析集計には性能・コスト面で不向き。大量データのインポートも必要で、データレイク上の特徴量生成には適さない。
解説
Amazon Athena は、S3上のデータに対して標準SQLを直接実行できるサーバーレスのクエリサービスです。クラスターのプロビジョニングや管理が不要で、スキャンしたデータ量に基づく従量課金のため、不定期・アドホックな利用に最適です。Parquetなどの列指向フォーマットを使えばスキャン量を削減でき、コストとパフォーマンスの両面で有利です。
選択肢Bの Amazon EMR で常時稼働クラスターは、アイドル時もコストが発生しクラスター管理の運用負担も大きいため不適切です。
選択肢Cの Amazon Redshift プロビジョンドクラスターは、事前ロードとクラスター運用が必要でアドホック用途には過剰です。
選択肢Dの Amazon RDS は大規模分析クエリ向けではなくOLTP用途で、TB規模の集計には不向きです。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →