あるECサイト企業では、レコメンデーション・不正検出・顧客チャーン予測の3つのMLモデルが、顧客行動に関する類似した特徴量をそれぞれ独立して計算しています。チームをまたいで同じ特徴量の再計算が発生しており、トレーニング時と推論時で特徴量の定義が一致しない問題も生じています。この問題を解決するために最も適切なアーキテクチャはどれですか?
SageMaker Feature StoreはMLに特化した特徴量管理サービスで、オンラインストア(DynamoDB基盤・低レイテンシのリアルタイム推論用)とオフラインストア(S3基盤・バッチトレーニング用)を統合管理します。特徴量をチーム横断で一元定義・共有できるため、トレーニングと推論間の特徴量一貫性(トレーニング/サービング歪みの防止)が保証されます。 選択肢Aの計算済み特徴量をAmazon DynamoDBに保存し、各モデルのトレーニング時にS3へ手動でエクスポートするは手動管理でトレーニング/サービング歪みが生じる可能性があります。 選択肢CのAmazon Redshiftを集中型特徴量ストアとして使用し、リアルタイム推論用にAmazon ElastiCacheでキャッシュするはMLに特化していない設計です。 選択肢Dのバージョン管理された特徴量データセットを格納した共有S3バケットを作成し、各チームがトレーニング時に参照する方法はS3による手動管理でトレーニング/サービング歪みが生じる可能性があります。