無限ノック › SAP 練習問題一覧 › 問題
SAP既存のソリューションの継続的改善

グローバルメディア配信企業が、5,000万人以上のデイリーアクティブユーザーを持つ動画ストリーミングプラットフォームを3リージョン(us-east-1、eu-west-1、ap-northeast-1)で運用しています。 【アラート疲弊(Alert Fatigue)の問題】 ・SREチーム(Site Reliability Engineering:サービス信頼性を担当するエンジニアリング組織)が1日600件以上のCloudWatchアラームを受信しており、対応が困難 ・アラームの80%以上が以下の理由による誤報(False Positive): - 深夜の定期バッチ処理による一時的なCPUスパイク - 週次コンテンツリリース時の正常なトラフィック急増 - タイムゾーンによる地域別の時間帯差分トラフィック変動 ・静的閾値のため曜日・時間帯のパターンが反映されていない ・重大インシデントが誤報に埋もれ、MTTD(Mean Time to Detect:インシデント平均検知時間)が45分に達している ・独立したサービスのアラームが文脈なしに発砲される(例:定期レポート処理中にDBのCPUアラームが単独で通知される) 【要件】 ・誤報率を80%以上削減する ・真のインシデントを100%検知する(見逃しゼロ) ・追加の外部ツール導入コストを最小化する ・計画メンテナンス時間帯のアラーム抑制を実現する 最小の運用オーバーヘッドで要件を満たすアーキテクチャはどれですか?

A
静的閾値アラームをAmazon CloudWatch Anomaly Detectionアラームに移行し、曜日・時間帯の周期パターンを自動学習させる。関連する複数のメトリクス(エラー率・レイテンシ・正常ホスト数)を組み合わせたCloudWatch Composite Alarmを設定し、複数条件が同時に満たされた場合のみ通知する。メンテナンス時間帯はCloudWatch Alarm Action SuppressorまたはSetAlarmState APIを使用してアラームアクションを無効化する。
✓ 正解
CloudWatch Anomaly DetectionはMLを使用して日次・週次の周期パターンを自動学習し、正常なビジネス変動による誤報を大幅に削減します。Composite Alarmは複数の独立したアラームをAND/OR条件で組み合わせ、文脈なしの単発アラームを防ぎます。Alarm Action Suppressorはメンテナンスウィンドウ中のアクション実行を抑制でき、これらはすべてAWSネイティブサービスで追加コスト最小化の要件を満たします。
B
Amazon Managed Grafanaをデプロイし、Amazon Managed Service for PrometheusへすべてのサービスからPrometheusメトリクスを収集する。Grafanaのマルチ条件アラートルールで誤報を抑制し、Grafanaのサイレンス(Silences)機能でメンテナンスウィンドウ中のアラートを抑制する。
Amazon Managed Grafana はCloudWatchメトリクスの可視化・アラートには有効ですが、CloudWatch Anomaly Detectionのような組み込みMLによる季節性学習機能がなく、Prometheusへの移行が必要なため構築コストが高くなります。
C
Amazon EventBridgeルールを使用してCloudWatchメトリクスデータをAWS Lambda関数に転送し、Lambda内でカスタム統計的異常検知アルゴリズムを実装する。アラート抑制ルールはAmazon DynamoDBに格納し、メンテナンスウィンドウはDynamoDBを参照するLambdaで制御する。通知はAmazon SNS経由でPagerDutyに送信する。
Amazon EventBridge ルールとLambda カスタムアルゴリズムは、AnomalyDetection・Composite Alarmで標準提供される機能を自前で再実装することになり、開発・テスト・運用コストが大幅に増加します。
D
AWS Fault Injection Simulator(FIS)を活用してカオスエンジニアリング実験を実施し、各アラームの誤報パターンを特定してAWS Configルールとして定義する。Config Remediationで自動的に閾値を調整し、重大インシデントはAWS Personal Health Dashboard(AWS Health)のAPIを使用してリアルタイムに検知する。
AWS Fault Injection Simulator はカオスエンジニアリングツールであり誤報削減には使用しません。AWS Health APIはAWSサービス自体の障害イベントを提供するものであり、アプリケーションメトリクスの異常検知には使用できません。

解説

CloudWatch Anomaly DetectionはMLを使用して日次・週次の周期パターンを自動学習し、正常なビジネス変動による誤報を大幅に削減します。Composite Alarmは複数の独立したアラームをAND/OR条件で組み合わせ、文脈なしの単発アラームを防ぎます。Alarm Action Suppressorはメンテナンスウィンドウ中のアクション実行を抑制でき、これらはすべてAWSネイティブサービスで追加コスト最小化の要件を満たします。 選択肢BのAmazon Managed Grafana はCloudWatchメトリクスの可視化・アラートには有効ですが、CloudWatch Anomaly Detectionのような組み込みMLによる季節性学習機能がなく、Prometheusへの移行が必要なため構築コストが高くなります。 選択肢CのAmazon EventBridge ルールとLambda カスタムアルゴリズムは、AnomalyDetection・Composite Alarmで標準提供される機能を自前で再実装することになり、開発・テスト・運用コストが大幅に増加します。 選択肢DのAWS Fault Injection Simulator はカオスエンジニアリングツールであり誤報削減には使用しません。AWS Health APIはAWSサービス自体の障害イベントを提供するものであり、アプリケーションメトリクスの異常検知には使用できません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでSAPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← SAP の問題一覧に戻る