SAA高性能なアーキテクチャの設計

IoTプラットフォーム企業が工場内10万台のセンサーからJSONデータを毎秒1GBで収集している。データは30秒ウィンドウでの集計を含む変換処理を施し、Parquet形式でS3データレイクに格納する必要がある。変換ロジックは業務要件の変化に応じて頻繁に更新される。カスタムインフラの管理工数を最小限に抑えたい場合、最も適切な構成はどれか。

A
Amazon Kinesis Data StreamsのデータをEC2上のApache Sparkクラスターに連携しParquet変換してS3に保存する
Amazon Kinesis Data StreamsとEC2 Sparkの組み合わせはクラスター管理・パッチ適用など運用工数が大きく、管理工数最小化の要件に反する。
B
Amazon Data Firehoseのデータ変換機能にLambda関数を設定してParquet変換し、S3へ配信する
Amazon Data FirehoseのLambda変換はレコード単位の処理で状態を持てず、30秒ウィンドウ集計のようなストリーム横断の集計処理ができない。
C
Amazon Kinesis Data StreamsとAWS Glue Streaming ETLを組み合わせてParquet変換しS3に格納する
✓ 正解
AWS Glue Streaming ETLはKinesisと統合しSparkウィンドウ集計をサーバーレスで実行でき、スクリプト変更のみでロジック更新が容易である。
D
Amazon MSKとセルフマネージドのApache Flinkアプリを使ってParquet変換を行いS3に書き込む
Amazon MSKとセルフマネージドFlinkはKafka・Flinkクラスターの管理が必要で、カスタムインフラ管理工数最小化の要件に反する。

解説

Glue Streaming ETLはKinesis Data Streamsとネイティブ統合し、Sparkベースのウィンドウ集計をサーバーレスで実行できる。スクリプト変更のみでロジックを更新でき、管理工数を最小化できる。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでSAAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
SAA の問題一覧に戻る