Amazon Textract でスキャンした PDF からフォームの項目と表を抽出する。
Amazon Textract は、文書からテキストとフォームの項目と表を抽出する目的特化型のサービスです。スキャンした画像に対して、どの見出しにどの値が対応するか、表の行と列がどう並んでいるかという構造を保ったまま結果を返します。
請求書の明細のように項目と表で構成された帳票は、この出力をそのまま基幹システムの入力に対応付けられます。モデルを訓練する準備は要らず、月に 2 万枚という量もそのまま処理できます。