PDF ファイルの解析
先延ばしにしていた小さなプロジェクトに取り組む必要があります。会社から、署名済み契約書の PDF ファイルが渡されました。プロジェクトの目的は、そこから抽出した情報でデータベースを作成することです。カラムのうち 3 つは、契約が署名された日、月、年に対応させます。
日付は Signed on 05/24/2016(05 が月、24 が日)という形式で現れます。この情報を抽出するために、キャプチャグループを使うことにしました。また、その情報を別々の変数に個別に保存できるように取得したいと考えています。
まずはプロトタイプを作ってみましょう。
1 件の契約書テキストを含む変数 contract と、re モジュールはすでにセッションに読み込まれています。IPython Shell でデータを確認するには print() を使えます。
この演習はコースの一部です
Pythonで学ぶ正規表現
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Write regex and scan contract to capture the dates described
regex_dates = r"____\s____\s(____)/(____)/(____)"
dates = re.____(____, ____)