無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

あるフィンテック企業は、リアルタイム不正検出MLモデルを構築しています。1日数百万件のトランザクションデータをストリーミングで処理し、モデルの推論時に最新の顧客行動特徴量(直近1時間の取引頻度・平均取引金額など)を低レイテンシーで参照できるようにする必要があります。また、モデルを週次で再トレーニングするために過去の特徴量データも保持する要件があります。この要件を最小限の運用負荷で満たすアーキテクチャはどれですか?

A
Amazon Kinesis Data Streams → AWS Lambda で特徴量を計算 → SageMaker Feature Store(オンラインストアとオフラインストアの両方に書き込み)を使用し、推論時はオンラインストアから特徴量を取得する
✓ 正解
SageMaker Feature Storeは1回の書き込みでオンラインストア(数ミリ秒の低レイテンシー単一レコード読み取り)とオフラインストア(S3ベース、バッチ学習・再トレーニング用)の両方へ自動同期されます。Kinesis Data Streams+Lambdaでリアルタイムに特徴量を計算しFeature Storeへ書き込むことで、推論時のオンライン参照と週次再トレーニング用のオフライン蓄積を単一パイプラインで実現でき、運用負荷も最小化できます。
B
Amazon Data Firehose → Amazon S3 → AWS Glue ETL → Amazon Redshift を使用し、推論時はRedshiftからSQLクエリで特徴量を取得する
Amazon Data Firehose→S3→Glue→Redshiftはバッチ分析向けの構成で、推論時にRedshiftへSQLクエリを発行すると応答が数十〜数百ミリ秒に及び、リアルタイム不正検出に必要な低レイテンシーな特徴量参照を満たせません。
C
Amazon Kinesis Data Streams → Amazon Managed Service for Apache Flink(旧Kinesis Data Analytics)→ Amazon S3 → SageMaker Data Wrangler で特徴量を生成し、S3に保存してエンドポイントから参照する
Managed Service for Apache Flinkでストリーム処理してもS3経由のSageMaker Data Wranglerはバッチ変換ツールであり、推論時の低レイテンシーな特徴量サービング用途には適しません。オンラインストアの仕組みも持ちません。
D
Amazon Data Firehose → Amazon S3 に生データを蓄積し、SageMaker Processing Job を1時間ごとに定期実行して特徴量を計算・S3に出力、推論時はそのS3ファイルを読み込む
Amazon Data Firehose→S3に蓄積しProcessing Jobを1時間ごとに実行する構成では特徴量の鮮度が最大1時間遅れとなり、直近1時間の取引頻度を参照する不正検出には不十分です。推論時のS3ファイル読み込みも低レイテンシー要件を満たせません。

解説

SageMaker Feature Storeは1回の書き込みでオンラインストア(低レイテンシー単一レコード読み取り、数ミリ秒)とオフラインストア(S3ベース、バッチ学習・再トレーニング用)の両方に自動同期されます。Kinesis Data Streams+Lambdaでリアルタイム特徴量計算を行いFeature Storeに書き込むことで、推論時のオンラインストア参照と週次再トレーニング用のオフラインストア活用を単一のパイプラインで実現できます。 選択肢BはリアルタイムにRedshiftクエリのレイテンシーは高すぎます。 選択肢CのAmazon Managed Service for Apache Flink経由でS3に書き込みSageMaker Data Wranglerで特徴量を生成する構成は、Data Wranglerがバッチ変換ツールであるためリアルタイム特徴量サービングには不適です。 選択肢Dの1時間ごとのProcessing Jobでは特徴量の鮮度が不足し、推論時のS3読み込みも低レイテンシー要件を満たせません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る