Parsování PDF souborů
Teď se pustíš do dalšího menšího projektu, který jsi odkládal/a. Firma ti předala PDF soubory s podepsanými smlouvami. Cílem projektu je vytvořit databázi s informacemi, které z nich vyextraktuješ. Tři ze sloupců by měly odpovídat dni, měsíci a roku podpisu smlouvy.
Data se v textu vyskytují ve formátu Signed on 05/24/2016 (kde 05 označuje měsíc a 24 den). Rozhodneš se použít zachytávající skupiny k extrakci těchto informací a uložit je do samostatných proměnných.
Nejdřív si celý postup otestuješ na jednom příkladu.
Proměnná contract obsahující text jedné smlouvy a modul re jsou v session už načteny. Data si můžeš prohlédnout pomocí print() v IPython Shellu.
Toto cvičení je součástí kurzu
Regular Expressions in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Write regex and scan contract to capture the dates described
regex_dates = r"____\s____\s(____)/(____)/(____)"
dates = re.____(____, ____)