あるフィンテック企業は、リアルタイム不正検出MLモデルを構築しています。1日数百万件のトランザクションデータをストリーミングで処理し、モデルの推論時に最新の顧客行動特徴量(直近1時間の取引頻度・平均取引金額など)を低レイテンシーで参照できるようにする必要があります。また、モデルを週次で再トレーニングするために過去の特徴量データも保持する要件があります。この要件を最小限の運用負荷で満たすアーキテクチャはどれですか?
SageMaker Feature Storeは1回の書き込みでオンラインストア(低レイテンシー単一レコード読み取り、数ミリ秒)とオフラインストア(S3ベース、バッチ学習・再トレーニング用)の両方に自動同期されます。Kinesis Data Streams+Lambdaでリアルタイム特徴量計算を行いFeature Storeに書き込むことで、推論時のオンラインストア参照と週次再トレーニング用のオフラインストア活用を単一のパイプラインで実現できます。 選択肢BはリアルタイムにRedshiftクエリのレイテンシーは高すぎます。 選択肢CのAmazon Managed Service for Apache Flink経由でS3に書き込みSageMaker Data Wranglerで特徴量を生成する構成は、Data Wranglerがバッチ変換ツールであるためリアルタイム特徴量サービングには不適です。 選択肢Dの1時間ごとのProcessing Jobでは特徴量の鮮度が不足し、推論時のS3読み込みも低レイテンシー要件を満たせません。