MLA機械学習のためのデータ準備
医療データ分析企業が 8TB の EHR(電子健康記録、Electronic Health Record)データに対して機械学習用の特徴量エンジニアリングを実施する必要があります。処理には複数テーブルの複雑な結合、カスタム UDF(ユーザー定義関数、User-Defined Function)、および特定の医療用 Python ライブラリが必要です。また、データサイエンティストはインタラクティブな Jupyter Notebook 環境で処理ロジックを反復開発したいと考えています。どのソリューションが最も要件を満たしますか?
AAWS Glue Studio を使用してビジュアル ETL パイプラインを構築し、カスタム Python シェルジョブで UDF を処理する
Glue Studioはビジュアルなパイプライン構築には適していますが、特定の医療用Pythonライブラリのインストール管理に制限があります。またデータサイエンティストがJupyter Notebookでインタラクティブにロジックを反復開発する環境としても不向きです。
BAmazon SageMaker Processing ジョブに Spark 対応コンテナを使用し、ジョブ実行のたびに必要なライブラリをインストールしてバッチ処理する
SageMaker Processingはバッチ処理ジョブの実行に特化しており、ジョブ開始から終了のサイクルごとに実行されるため、データサイエンティストがJupyter Notebookでインタラクティブに処理ロジックを反復開発する環境には適していません。ライブラリもジョブ実行ごとにインストールが必要で非効率です。
CAmazon EMR クラスターに JupyterHub をインストールし、ブートストラップアクションでカスタム医療用ライブラリをセットアップしてインタラクティブな Spark 開発環境を構築する
✓ 正解
Amazon EMRはブートストラップアクションで医療用Pythonライブラリを含む任意のソフトウェアをセットアップでき、JupyterHubを通じたインタラクティブなSpark開発環境を提供します。8TB規模の大規模データと複雑な結合処理・カスタムUDFにも対応でき、全要件を満たす最適解です。
DAWS Lambda 関数を並列実行してデータを分割処理し、Amazon S3 に結果を書き込む
Lambdaは処理時間(最大15分)とメモリ(最大10GB)に制限があり、8TB規模の複雑な結合処理や特定の医療用Pythonライブラリを使ったSpark処理には適していません。データを分割しても全体の整合性管理が困難で、スケーラブルなML特徴量エンジニアリングには不向きです。
解説
Amazon EMR クラスターに JupyterHub をインストールし、ブートストラップアクションでカスタム医療用ライブラリをセットアップしてインタラクティブな Spark 開発環境を構築する
Amazon EMR はブートストラップアクションで任意のソフトウェアをインストールでき、JupyterHub を通じたインタラクティブな Spark 開発環境を提供します。
選択肢Aの Glue Studio はカスタムライブラリのサポートに制限があります。
選択肢BのSageMaker Processing はバッチ処理向けでインタラクティブ開発には不向きです。
選択肢DのLambda は処理時間・メモリに制限があり 8TB 規模の複雑な Spark 処理には適していません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →