無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

ゲーム会社がプレイヤーの行動ログ(1 秒あたり約 50,000 イベント)をリアルタイムで収集し、ML モデルのトレーニング用データとして S3 に蓄積するシステムを構築しています。要件は次の通りです: ① データを S3 に Apache Parquet 形式で変換して保存する ② 5 分または 128MB ごとにバッファリングして S3 に書き込む ③ S3 に書き込まれたデータを自動的に AWS Glue データカタログに登録する。 最も運用負荷が低いアーキテクチャはどれですか?

A
Amazon Kinesis Data Streams → AWS Lambda(Parquet 変換処理)→ Amazon S3 → AWS Glue クローラー(スケジュール実行)
Lambdaでの変換ロジック実装とGlueクローラーの定期実行スケジュール管理が別途必要であり、運用負荷が増加します。Parquet変換の実装・テストやクローラー設定のメンテナンスも追加の開発コストとなり、フルマネージドのData Firehoseに比べて管理範囲が広がります。
B
Amazon Kinesis Data Streams → Amazon Data Firehose(Parquet 変換・バッファリング・Glue データカタログ統合を設定)→ Amazon S3
✓ 正解
Data Firehoseは時間・サイズベースのバッファリング、Apache Parquet形式への自動変換、Glueデータカタログへの自動登録をフルマネージドで提供します。追加コンポーネントの管理が不要で運用がシンプルであり、3つの要件すべてを単一サービスで満たす最適解です。
C
Amazon MSK(Managed Streaming for Apache Kafka)→ Amazon EMR Spark Streaming → Amazon S3 → AWS Glue クローラー(スケジュール実行)
EMRクラスターの起動・管理・スケーリングが必要であり、ビッグデータ処理には適していますが、このシナリオでは過度に複雑です。Parquet変換やGlueカタログ登録のために複数コンポーネントの連携設定も必要で、クラスター管理のコストと運用負荷が大きくなります。
D
Amazon API Gateway → AWS Lambda(バッファリング管理)→ Amazon Kinesis Data Streams → Amazon S3
API Gateway経由のLambdaはバッファリング管理が複雑で、Lambdaのタイムアウト制限(最大15分)が大量イベントのバッファリング処理の障壁になります。またApache Parquet形式への変換やGlueデータカタログへの自動登録機能も持たず、要件を満たすためには追加の実装が必要です。

解説

Amazon Kinesis Data Streams → Amazon Data Firehose(Parquet 変換・バッファリング・Glue データカタログ統合を設定)→ Amazon S3。 Amazon Data Firehose は、時間・サイズベースのバッファリング設定、Glue スキーマを参照した Apache Parquet への自動変換、および Glue データカタログへの自動登録を単一のフルマネージドサービスで提供します。 A は Lambda での変換ロジックとクローラー管理が別途必要で運用負荷が増大します。 C は EMR クラスター管理が必要で複雑です。 D は Lambda のバッファリングは Data Firehose に比べ制限があります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る