無限ノック › MLA 練習問題一覧 › 問題
MLAMLモデルの開発

大手電力会社が、全国の工場・ビルに設置した50万台のIoTセンサーから毎時間収集する電力消費量データの異常(設備故障・不正消費など)をリアルタイムに検出するシステムをSageMakerで構築しています。異常として明示的にラベル付けされたデータはほとんど存在しません。各データポイントに対して「異常らしさ」を数値スコアとしてスケーラブルに算出できる、最も適したSageMaker組み込みアルゴリズムはどれですか?

A
SageMaker Random Cut Forest(RCF)を使用し、ラベルなしデータへの教師なし学習で各ポイントの異常スコアをリアルタイムかつスケーラブルに付与する
✓ 正解
SageMaker RCFはランダム分割木による教師なし異常検知専用の組み込みアルゴリズムで、ラベルなしデータへの教師なし学習・シャーディングによる大規模分散処理・リアルタイムエンドポイントデプロイをすべてネイティブにサポートし、本シナリオの全要件を直接満たす。
B
SageMaker DeepARを使用してセンサーごとの電力消費量を時系列予測し、実測値と予測値の乖離が設定した閾値を超えたデータポイントを異常として間接的に検知する
SageMaker DeepARは時系列予測専用アルゴリズムであり、将来値の予測は得意だが異常スコアを直接出力する機能はない。異常検知には予測誤差と閾値の手動設定が必要な間接的アプローチになり、専用アルゴリズムと比べて設計の複雑さと精度調整の負荷が高くなる。
C
SageMaker XGBoostを使用し、少量の異常ラベルデータと大量の正常データを組み合わせて不均衡な二値分類モデルをトレーニングし、推論時に異常フラグを出力する
SageMaker XGBoostは教師あり学習を前提とした勾配ブースティングアルゴリズムであり、二値分類には明示的なラベル付きデータが必要になる。本シナリオでは異常ラベルがほとんど存在しないため、このアプローチは要件の前提条件と直接矛盾する。
D
SageMaker K-Meansを使用して正常消費パターンのクラスタを事前学習し、各クラスタ重心からのユークリッド距離が一定値を超えたデータポイントを異常と判定する
SageMaker K-Meansはクラスタリングアルゴリズムであり、クラスタ重心からの距離で異常を測る使い方も存在するが、異常スコアを直接出力する設計ではなく後処理が必要になる。また季節性・トレンドを持つ時系列データへの対応がRCFより複雑になる。

解説

SageMaker Random Cut Forest(RCF)は、ランダム分割木の森を用いた教師なし異常検知専用の組み込みアルゴリズムです。各データポイントをツリーに挿入した際の平均深度(anchor depth)から異常スコアを算出し、スコアが高いほど「異常らしい」データポイントを示します。 RCFの主な特徴は以下の通りです。 ・ラベル付きデータが不要な教師なし学習 ・シャーディングによる大規模データへのスケーラブルな分散処理 ・SageMakerリアルタイムエンドポイントへのデプロイが可能 ・時系列データの季節性・トレンド成分の処理にも対応 「ラベルなし」「スケーラブル」「異常スコアのリアルタイム算出」という要件をすべてネイティブに満たすのはRCFのみです。 選択肢BのSageMaker DeepARは時系列予測専用アルゴリズムであり、将来値の予測には優れますが異常スコアを直接出力する機能はなく、予測誤差と閾値の手動設定が必要な間接的なアプローチになります。 選択肢CのSageMaker XGBoostは教師あり学習を前提とした勾配ブースティングアルゴリズムであり、明示的なラベル付きデータが必要です。「異常ラベルがほとんど存在しない」という前提に直接矛盾します。 選択肢DのSageMaker K-Meansはクラスタリングアルゴリズムであり、クラスタ重心からの距離で異常度を測る手法も存在しますが、異常スコアを直接出力する設計ではなく後処理が必要です。RCFと比べてリアルタイム異常検知の精度と運用性で劣ります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る