MLA機械学習のためのデータ準備
クレジットカード不正検知モデルを再学習するMLエンジニアは、過去の取引履歴を使って学習データセットを作成しています。集計特徴量(例:過去30日の利用回数)は取引発生時点と現時点で値が異なるため、現時点の値を使うと将来の情報が学習データに混入するデータリーケージ(data leakage:モデル学習時に本来利用できないはずの情報が混入する問題)が発生します。SageMaker Feature Storeを使ってこの問題を回避する正しいアプローチはどれですか?
AFeature Storeのオンラインストアにのみ特徴量を保存し、学習時にリアルタイムで最新値を取得する
オンラインストアは現在の最新値のみを返すため、将来の取引の最新値が混入するデータリーケージ(将来情報漏洩)の原因になります。学習データ作成には不適切です。
BFeature Storeのオフラインストアでポイントインタイムクエリを使用し、各取引発生時点での特徴量値を取得する
✓ 正解
Feature Storeのオフラインストアはイベント時刻を保持しており、ポイントインタイムクエリで各取引時点での特徴量値のみを取得でき、将来情報の混入(リーケージ)を防げます。推論精度向上に有効です。
CSageMaker Clarifyのバイアス検出機能で特徴量のドリフトを検出してから学習データを作成する
SageMaker Clarifyはバイアス・公平性分析に特化したツールであり、特徴量ドリフト検出機能ではありません。特徴量の時系列管理ソリューションではないため、この目的には不適です。
DSageMaker Experimentsで実験ごとに特徴量のスナップショットを保存し、再学習時に参照する
SageMaker Experimentsは実験追跡・比較用であり、特徴量の履歴管理・ポイントインタイムクエリ機能を持たないため、この要件に対応していません。
解説
SageMaker Feature Storeのオフラインストアは全レコードのイベント時刻を保持しており、ポイントインタイムクエリにより各取引が発生した時点で記録されていた特徴量値のみを取得できます。これにより将来の情報が混入するデータリーケージを防げます。オンラインストア(A)は現在の最新値のみを返すためリーケージの原因になります。SageMaker Clarify(C)はバイアス・公平性分析ツールです。SageMaker Experiments(D)は実験追跡用であり特徴量の履歴管理には使用しません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →