MLエンジニアが、Amazon S3上の50GBのテキストデータに対してNLTK(自然言語処理ライブラリ)によるトークナイズとscikit-learnによる特徴量スケーリングを行うカスタムPythonスクリプトを実行し、前処理済みデータをS3に保存した後にSageMaker Training Jobに渡す必要があります。SageMaker Pipelinesへの組み込みやすさと依存ライブラリの確実な管理を最優先にした場合、最適な方法はどれですか?
SageMaker Data WranglerのカスタムTransformブロックにNLTKとscikit-learnのロジックを記述して前処理フローを構築する
SageMaker Data WranglerはGUIベースのデータ変換ツールでカスタムTransformブロックはPandasを前提としています。NLTKやscikit-learnのカスタムスクリプトを50GB規模のデータに適用するには処理効率とメモリの面で不向きで、依存ライブラリの確実な管理も困難です。