あるEコマース企業が、リアルタイム推論で利用する特徴量を準備しています。クリックストリームのイベントを継続的に取り込み、ユーザーごとの最新の集計特徴量を低レイテンシーで参照できるようにしたい一方、同じ特徴量をバッチ再学習でも利用したいと考えています。ストリーミングデータをML特徴量として取り込み、オンライン・オフライン双方で一貫して利用する最適な構成はどれですか。
SageMaker Feature Store は、オンラインストア(低レイテンシーのリアルタイム参照用)とオフラインストア(S3上の履歴データ・バッチ学習用)を併せ持ち、同一の特徴量定義を両方で一貫して利用できます。Kinesis Data Streams でクリックストリームを取り込み、Lambda で集計して PutRecord API でオンラインストアに書き込むと、オフラインストアへ自動的に複製され、リアルタイム推論とバッチ再学習の両方を単一の特徴量ソースで賄えます。 選択肢Bの構成は、低レイテンシーのオンライン参照とオフライン学習の一貫性を担保できません。 選択肢Cの DynamoDB スキャンは特徴量管理機能を欠き、スキャンは低レイテンシーの単一エンティティ取得に不向きです。 選択肢Dの CloudWatch Logs Insights はログ分析用で、リアルタイム特徴量配信の用途には適しません。