無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

ある金融会社が Apache Kafka(分散メッセージストリーミング基盤)を使ったリアルタイムデータパイプラインを構築しています。複数の社内チームがトランザクションデータをストリームに書き込みますが、チームがスキーマを変更した際に下流の SageMaker トレーニングジョブや SageMaker Feature Store への取り込みパイプラインが破損することが問題になっています。プロデューサー(データ送信側)とコンシューマー(データ受信側)間でスキーマの整合性を強制し、後方互換性のない変更を事前に自動拒否できる AWS ソリューションとして最も適切なものはどれですか?

A
AWS Glue Schema Registry を導入し、Kafka トピックのスキーマを Avro または JSON Schema 形式で登録する。互換性モードを BACKWARD に設定し、Glue Schema Registry ライブラリを使ってプロデューサー側でシリアライズ時にスキーマ検証、コンシューマー側で自動デシリアライズするよう統合する。
✓ 正解
AWS Glue Schema Registry はストリーミングアプリケーション向けにスキーマのバージョン管理と互換性チェックを提供するマネージドサービスです。Kafka・Amazon Kinesis Data Streams・Amazon MSK(Managed Streaming for Apache Kafka)と統合でき、BACKWARD 互換モードを設定するとプロデューサーが送信前にスキーマを検証し、後方互換性のないスキーマバージョン(例:既存フィールドの削除や型変更)の登録・送信を自動拒否します。これにより不正データがパイプラインに流入する前に防止できます。
B
Amazon S3 バージョニングを有効にして各スキーマ定義ファイルを S3 に保存し、AWS Lambda でオブジェクトの差分を検出してスキーマ変更を管理する。
S3バージョニングはオブジェクトファイルの版管理であり、ストリーミングデータのリアルタイムスキーマ検証には使用できません。
C
AWS Glue Crawler を 1 時間ごとに実行して Kafka 内のデータの変化を検出し、Glue Data Catalog のスキーマを自動更新する。
Glue Crawlerは S3 や JDBC データソース向けのスキーマ検出ツールであり、Kafka ストリームのリアルタイム検証はサポートしていません。
D
Amazon CloudWatch Logs Insights でトレーニングジョブのエラーログを分析し、スキーマ不整合を検知した場合に EventBridge ルールで自動リトライをトリガーする。
CloudWatch + EventBridgeによるリトライは障害発生後の事後対処であり、互換性のないデータがパイプラインに流入することを防ぐ予防策にはなりません。

解説

AWS Glue Schema Registry はストリーミングアプリケーション向けにスキーマのバージョン管理と互換性チェックを提供するマネージドサービスです。Kafka・Amazon Kinesis Data Streams・Amazon MSK(Managed Streaming for Apache Kafka)と統合でき、BACKWARD 互換モードを設定するとプロデューサーが送信前にスキーマを検証し、後方互換性のないスキーマバージョン(例:既存フィールドの削除や型変更)の登録・送信を自動拒否します。これにより不正データがパイプラインに流入する前に防止できます。 選択肢BのS3バージョニングはオブジェクトファイルの版管理であり、ストリーミングデータのリアルタイムスキーマ検証には使用できません。 選択肢CのGlue Crawlerは S3 や JDBC データソース向けのスキーマ検出ツールであり、Kafka ストリームのリアルタイム検証はサポートしていません。 選択肢DのCloudWatch + EventBridgeによるリトライは障害発生後の事後対処であり、互換性のないデータがパイプラインに流入することを防ぐ予防策にはなりません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る