MLA機械学習のためのデータ準備

フィンテック企業がリアルタイム不正検知パイプラインを構築している。決済端末から毎分15万件のトランザクションが発生し、オンライン特徴量計算・監査ログ・監視システムの3サービスが独立してデータを消費する必要がある。デバッグや再学習のためデータは7日間の再読み取り(リプレイ)が必須で、運用チームはクラスター管理の負担を最小化したい。これら全要件を満たすデータ取り込みサービスはどれか。

A
Amazon Data Firehose でS3にデータをバッファリング配信後、S3イベント通知をトリガーにLambdaで処理する
Amazon Data Firehose は最小60秒のバッファリングがあり、サブ秒レイテンシーが求められるオンライン特徴量計算の要件を満たさない。
B
Amazon Kinesis Data Streams にデータを取り込み、各コンシューマーが独立してシャードを読み取る
✓ 正解
Amazon Kinesis Data Streams は複数コンシューマーの並列読み取り・リプレイ・サブ秒レイテンシーを完全マネージドで提供し、全要件を満たす。
C
Amazon MSK でApache Kafkaクラスターをマルチブローカー構成で構築し、Consumer Groupで配信する
Amazon MSK はKafkaのコンシューマーグループとリプレイをサポートするが、EC2ベースのブローカー管理が必要でクラスター運用負荷が残る。
D
Amazon SQS FIFO キューでメッセージを受信し、Lambdaで処理後にElastiCacheへ書き込む
Amazon SQS は消費済みメッセージが削除されるアーキテクチャであり、7日間のデータリプレイ要件を満たすことができない。

解説

Kinesis Data Streams は複数独立コンシューマーへの並列配信・最大365日のデータ保持によるリプレイ・サブ秒レイテンシーを完全マネージドで提供し、クラスター管理が不要。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る