AIFAIとMLの基礎
ある金融機関が、数万件の紙ベースのローン申請書をデジタル化するプロジェクトを進めています。スキャンされたPDFには、申請者の氏名・住所などのフォーム項目と、融資額・金利・返済期間などを含む表形式のデータが混在しています。これらのPDFから構造化データを自動抽出するのに最も適したAWSサービスはどれですか?
AAmazon Rekognition
(Amazon Rekognition)は画像や動画の物体検出・顔認識・コンテンツモデレーションに特化したサービスであり、ドキュメント内の表やフォーム構造の抽出は設計目的外です。
BAmazon Textract
✓ 正解
Amazon Textract。
Amazon Textractは、スキャンされたドキュメントやPDFからテキスト、フォーム(キーと値のペア)、テーブル(表形式データ)を自動的に抽出するAWSサービスです。単純なOCR(光学文字認識)を超えてドキュメントの構造を理解し、フォームフィールドや表の内容を構造化データとして取り出せる点が特徴です。
CAmazon Comprehend
(Amazon Comprehend)はテキストの感情分析・エンティティ抽出・キーフレーズ抽出など自然言語処理(NLP)に特化しており、画像やPDFからのデータ抽出機能はありません。テキスト入力が前提です。
DAmazon Kendra
(Amazon Kendra)はドキュメントに対する自然言語検索エンジンであり、Q&A型の検索基盤を提供しますが、スキャンPDFから表・フォームデータを構造化抽出する用途には適していません。
解説
Amazon Textract。
Amazon Textractは、スキャンされたドキュメントやPDFからテキスト、フォーム(キーと値のペア)、テーブル(表形式データ)を自動的に抽出するAWSサービスです。単純なOCR(光学文字認識)を超えてドキュメントの構造を理解し、フォームフィールドや表の内容を構造化データとして取り出せる点が特徴です。
選択肢A(Amazon Rekognition)は画像や動画の物体検出・顔認識・コンテンツモデレーションに特化したサービスであり、ドキュメント内の表やフォーム構造の抽出は設計目的外です。
選択肢C(Amazon Comprehend)はテキストの感情分析・エンティティ抽出・キーフレーズ抽出など自然言語処理(NLP)に特化しており、画像やPDFからのデータ抽出機能はありません。テキスト入力が前提です。
選択肢D(Amazon Kendra)はドキュメントに対する自然言語検索エンジンであり、Q&A型の検索基盤を提供しますが、スキャンPDFから表・フォームデータを構造化抽出する用途には適していません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →