無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

データサイエンスチームは、S3にParquet形式で保存された2TBの商品レビューデータからMLモデルを構築する前に、特徴量の分布確認・欠損値の割合・外れ値の検出をアドホック(都度実行)なSQLクエリで行いたいと考えています。データをS3から移動させず、インフラを管理することなく、スキャンしたデータ量だけ課金されるコスト効率の高い方法を求めています。最も適切なサービスはどれですか?

A
Amazon RedshiftにCOPYコマンドでデータをインポートしてSQLクエリを実行する
「Amazon RedshiftにCOPYコマンドでデータをインポートしてSQLクエリを実行する」はデータロードが必要でクラスターコストが発生します。
B
Amazon AthenaでS3上のParquetデータを直接SQLクエリする
✓ 正解
Amazon Athenaはサーバーレスのインタラクティブクエリサービスで、S3上のデータを移動させずに標準SQLで直接クエリできます。Parquet等の列指向フォーマットを効率的に処理し、スキャンしたデータ量のみ課金されます。
C
SageMaker Processing JobにPandasを使用してデータ全体を読み込み統計を計算する
「SageMaker Processing JobにPandasを使用してデータ全体を読み込み統計を計算する」はジョブ起動のたびにインスタンスを立ち上げ、全データをスキャンするためアドホッククエリには非効率です。
D
AWS GlueジョブでデータをCSVに変換してからAmazon RDSにロードしてクエリする
「AWS GlueジョブでデータをCSVに変換してからAmazon RDSにロードしてクエリする」はデータ移動が必要で余分なコストが生じます。

解説

Amazon Athenaはサーバーレスのインタラクティブクエリサービスで、S3上のデータを移動させずに標準SQLで直接クエリできます。Parquet等の列指向フォーマットを効率的に処理し、スキャンしたデータ量のみ課金されます。 選択肢Aの「Amazon RedshiftにCOPYコマンドでデータをインポートしてSQLクエリを実行する」はデータロードが必要でクラスターコストが発生します。 選択肢Cの「SageMaker Processing JobにPandasを使用してデータ全体を読み込み統計を計算する」はジョブ起動のたびにインスタンスを立ち上げ、全データをスキャンするためアドホッククエリには非効率です。 選択肢Dの「AWS GlueジョブでデータをCSVに変換してからAmazon RDSにロードしてクエリする」はデータ移動が必要で余分なコストが生じます。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る