あるデータパイプラインは複数のAWS Glueジョブを順番に実行している。特定のGlueジョブが一時的なスロットリングで断続的に失敗するため、失敗時に指数バックオフで自動リトライしつつ、すべてのリトライが失敗した場合のみ運用チームに通知したい。最小の運用負荷で実現する構成はどれか。
AWS Step Functions はタスクごとに IntervalSeconds と BackoffRate による指数バックオフ Retry を宣言的に設定でき、リトライ枯渇時に Catch で Amazon SNS 通知タスクへ分岐できる。サーバーレスで追加の実行基盤が不要なため運用負荷が最小。 選択肢Bの Glue Workflow は固定回数リトライで指数バックオフを制御できない。 選択肢Cの EventBridge+Lambda はリトライ管理を自前実装する必要がある。 選択肢Dの MWAA は常時稼働のAirflow環境管理が必要で運用負荷が過大。