無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

製造ラインの 500 台の IoT センサーから毎秒 5,000 件のテレメトリデータが送信されています。 このデータを ML モデルのトレーニング用として Amazon S3 に Apache Parquet 形式で保存し、日時によるパーティション設定が必要です。 取り込みから 15 分以内にデータを参照可能にしつつ、コード開発と管理を最小化する最も効率的なアーキテクチャはどれですか。

A
AWS Lambda 関数でデータを受信してバッファリングし、一定量に達した時点で Parquet に変換して S3 に自動書き込みする
AWS Lambda は最大 15 分の実行時間制限・メモリ制限・同時実行数制限があり、毎秒 5,000 件の高スループットデータのバッファリングには向かない。カスタムコードの開発と管理が必要となり、コード最小化の要件にも反する。
B
Amazon Data Firehose でデータを受信し、Parquet 変換・バッファリング・S3 配信を組み込み機能として一元設定する
✓ 正解
Amazon Data Firehose は Parquet への変換・バッファリング・S3 への日時パーティション書き込みをすべて組み込み機能として提供するフルマネージドサービス。コード開発不要でサーバーレス自動スケーリングに対応し、管理最小化と 15 分以内の配信要件を同時に満たす。
C
Amazon Kinesis Data Streams でデータを受信し、AWS Glue Streaming ETL ジョブで Parquet に変換して S3 へ書き込む
Kinesis Data Streams と Glue Streaming ETL の組み合わせは動作するが、Kinesis のシャード数管理と Glue ジョブの設定・監視が個別に必要となる。Data Firehose 単体と比較してコンポーネントが増え管理負荷が高い。
D
Amazon MSK クラスターを構築し、Kafka Connect の S3 Sink コネクタを設定して Parquet 形式に変換しながら S3 に保存する
Amazon MSK(Managed Kafka)はクラスターの起動・設定・スケーリング・パッチ適用などの管理が必要で、Kafka Connect コネクタの設定も別途必要。S3 への取り込みのみを目的とする場合はオーバースペックで管理コストが高い。

解説

Amazon Data Firehose はフルマネージドなデータ配信サービスで、Apache Parquet・ORC 形式へのデータ変換(AWS Glue データカタログのスキーマを使用)を組み込み機能として提供している。バッファリング間隔(最短 60 秒)と S3 プレフィックスによる日時パーティション設定も標準機能として設定可能。コードの記述や追加コンポーネントの管理が不要で、サーバーレスかつ自動スケーリングにより高スループットにも対応できる。 選択肢Aの AWS Lambda は実行時間最大 15 分とメモリ・同時実行数の制限があり、毎秒 5,000 件の高スループットデータを信頼性高くバッファリングする用途には適していない。 選択肢Cの Kinesis Data Streams と Glue Streaming ETL の組み合わせは有効だが、シャード管理と Glue ジョブの設定・監視が別途必要となり、Data Firehose 単体と比較して管理コンポーネントが増加する。 選択肢Dの Amazon MSK は高機能な Kafka 互換プラットフォームだが、クラスターのプロビジョニング・スケーリング・パッチ管理が必要で、S3 への Parquet 取り込みのみを目的とした用途にはオーバースペックとなる。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る