無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

あるEコマース企業が顧客レビューテキスト(500万件)を使ったセンチメント分類モデルを構築しています。S3に保存されたテキストデータから、感情スコア・エンティティ・キーフレーズをML用の特徴量として一括抽出し、後続のモデルトレーニングに活用したいと考えています。最小限の実装コストで大量テキストを処理するための最も適切なアプローチはどれですか?

A
SageMaker Processing JobにNLTK・spaCyライブラリをインストールし、カスタムNLPスクリプトで全500万件のテキストから特徴量を独自実装で抽出してS3に保存する
NLTK・spaCyによるカスタムNLP実装は要件に対応できるが、スクリプト開発・ライブラリ管理・チューニングが必要で、既製のマネージドNLPサービスと比較して実装コストが大幅に増加する。
B
AWS Glue ETLジョブでテキストデータをトークン化してSpark MLlibのWord2Vecアルゴリズムで埋め込みベクトルを生成し、感情・エンティティ特徴量の代替としてS3に出力する
Word2Vecは単語の意味的類似性を捉えた埋め込みを生成できるが、感情スコアやエンティティの識別には直接対応しておらず、要件で求められる感情・エンティティ・キーフレーズの全特徴量をカバーできない。
C
Amazon Comprehendのバッチ非同期分析ジョブでS3のテキストデータから感情スコア・エンティティ・キーフレーズを一括抽出し、NLPの専門実装なしに大規模テキスト処理を実現する
✓ 正解
Amazon Comprehendのバッチ非同期分析ジョブはS3上の大量テキストを処理でき、感情スコア・エンティティ・キーフレーズを事前トレーニング済みモデルで一括抽出できる。NLPの専門知識や独自モデル開発が不要で、実装コストを最小化できる。
D
Amazon Translateで全レビューを英語に統一翻訳した後、SageMaker Data Wranglerのテキスト変換機能で特徴量を手動抽出してトレーニング用データセットを作成する
Amazon Translateは言語翻訳サービスであり、感情スコア・エンティティ・キーフレーズの抽出機能は持たない。さらにData Wranglerでの手動操作は500万件規模の処理には適しておらず、本番パイプラインとしてスケールしない。

解説

Amazon ComprehendはAWS提供のフルマネージドNLPサービスで、感情分析・エンティティ認識・キーフレーズ抽出・言語検出・構文解析などの機能を事前トレーニング済みモデルとして提供する。S3上の大量テキストに対してバッチ非同期分析ジョブ(StartSentimentDetectionJob・StartEntitiesDetectionJob等)を起動することで、NLPモデルの開発知識不要で500万件を大規模並列処理できる。独自実装と比較して開発期間・運用コストを大幅に削減でき、ML特徴量生成のデータ準備フェーズに最適。 選択肢AのSageMaker Processing Job(NLTK/spaCy)は、柔軟性は高いが、ライブラリのセットアップ・スクリプト開発・実行環境管理が必要で実装コストが高い。 選択肢BのAWS Glue ETL(Word2Vec)は単語埋め込みを生成できるが、感情スコアやエンティティ抽出には対応しておらず、要件の全特徴量を一括生成できない。 選択肢DのAmazon Translateは言語統一に使えるが特徴量抽出機能を持たず、Data Wranglerによる手動抽出は500万件の大規模処理には非効率。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る