MLA機械学習のためのデータ準備
金融会社のMLチームが、顧客の取引履歴や信用スコアなど複数のMLモデルで共通して使用する特徴量セットを管理しています。モデルの学習時と本番推論時で同じ特徴量変換が確実に適用されるようにし、各モデルで重複した特徴量計算を避けたいと考えています。この要件を満たす最も適切なアーキテクチャはどれですか?
A特徴量をParquet形式でS3バケットに保存し、各モデルのトレーニングスクリプトから個別に参照してモデルを学習させる
S3へのParquet保存は学習データの永続化には有効ですが、学習時と推論時で異なる変換ロジックが使われるTraining-Serving Skewを防ぐ仕組みがなく、複数モデルでの重複計算も生じます。
BAmazon SageMaker Feature Storeを使用し、オフラインストアとオンラインストアの両方から特徴量を一元管理・提供する
✓ 正解
SageMaker Feature Storeはオフラインストア(バッチ学習)とオンラインストア(低レイテンシ推論)を統合管理し、同一の特徴量変換を学習・推論の両フェーズで一貫して適用できます。チーム間の特徴量再利用も容易です。
CモデルごとにAWS Glue ETLジョブを別途作成し、それぞれ独立した変換ロジックで特徴量を計算してS3に書き出す
モデルごとに独立したETLジョブを持つ構成では、変換ロジックがずれてTraining-Serving Skewが発生するリスクがあります。また同じ特徴量を複数のジョブで重複計算するため運用コストも増大します。
Dリアルタイムアクセス用にAmazon DynamoDB、学習データ用にS3を個別管理し、2ストア間のデータを手動バッチで同期させる
DynamoDBとS3を手動で同期させる構成は、タイミングのずれや同期漏れが生じやすく一貫性の保証が困難です。また同期処理の設計・運用コストが高く、特徴量ドリフトによるモデル精度劣化のリスクもあります。
解説
Amazon SageMaker Feature Storeは特徴量の一元管理・共有・再利用を可能にするマネージドサービスです。オフラインストア(S3ベース)でバッチ学習用データを提供し、オンラインストア(低レイテンシ)でリアルタイム推論時の特徴量をミリ秒単位で取得できます。これにより学習・推論間での特徴量変換の一貫性(Training-Serving Skewの防止)と、チーム間での特徴量の再利用が実現できます。
選択肢AはS3単体での管理です。学習時と推論時で異なる変換ロジックが使われるリスクを防ぐ仕組みがなく、Training-Serving Skewが発生しやすい構成です。また複数モデルが個別に特徴量を計算するため重複計算のコストも生じます。
選択肢CはモデルごとにETLジョブを独立して持つ構成です。変換ロジックがずれてTraining-Serving Skewが発生するリスクがあり、要件の「各モデルで重複した特徴量計算を避けたい」にも反します。
選択肢DはDynamoDBとS3を手動で同期させる構成です。同期漏れやタイミングのずれにより一貫性を保証することが困難で、同期処理の設計・運用コストが高く、スケーラビリティにも課題があります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →