MLA機械学習のためのデータ準備
データサイエンスチームは、S3にParquet形式で保存された2TBの商品レビューデータからMLモデルを構築する前に、特徴量の分布確認・欠損値の割合・外れ値の検出をアドホック(都度実行)なSQLクエリで行いたいと考えています。データをS3から移動させず、インフラを管理することなく、スキャンしたデータ量だけ課金されるコスト効率の高い方法を求めています。最も適切なサービスはどれですか?
AAmazon RedshiftにCOPYコマンドでデータをインポートしてSQLクエリを実行する
「Amazon RedshiftにCOPYコマンドでデータをインポートしてSQLクエリを実行する」はデータロードが必要でクラスターコストが発生します。
BAmazon AthenaでS3上のParquetデータを直接SQLクエリする
✓ 正解
Amazon Athenaはサーバーレスのインタラクティブクエリサービスで、S3上のデータを移動させずに標準SQLで直接クエリできます。Parquet等の列指向フォーマットを効率的に処理し、スキャンしたデータ量のみ課金されます。
CSageMaker Processing JobにPandasを使用してデータ全体を読み込み統計を計算する
「SageMaker Processing JobにPandasを使用してデータ全体を読み込み統計を計算する」はジョブ起動のたびにインスタンスを立ち上げ、全データをスキャンするためアドホッククエリには非効率です。
DAWS GlueジョブでデータをCSVに変換してからAmazon RDSにロードしてクエリする
「AWS GlueジョブでデータをCSVに変換してからAmazon RDSにロードしてクエリする」はデータ移動が必要で余分なコストが生じます。
解説
Amazon Athenaはサーバーレスのインタラクティブクエリサービスで、S3上のデータを移動させずに標準SQLで直接クエリできます。Parquet等の列指向フォーマットを効率的に処理し、スキャンしたデータ量のみ課金されます。
選択肢Aの「Amazon RedshiftにCOPYコマンドでデータをインポートしてSQLクエリを実行する」はデータロードが必要でクラスターコストが発生します。
選択肢Cの「SageMaker Processing JobにPandasを使用してデータ全体を読み込み統計を計算する」はジョブ起動のたびにインスタンスを立ち上げ、全データをスキャンするためアドホッククエリには非効率です。
選択肢Dの「AWS GlueジョブでデータをCSVに変換してからAmazon RDSにロードしてクエリする」はデータ移動が必要で余分なコストが生じます。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →