Začněte nyníZačněte zdarma

Parsování PDF souborů

Teď se pustíš do dalšího menšího projektu, který jsi odkládal/a. Firma ti předala PDF soubory s podepsanými smlouvami. Cílem projektu je vytvořit databázi s informacemi, které z nich vyextraktuješ. Tři ze sloupců by měly odpovídat dni, měsíci a roku podpisu smlouvy.
Data se v textu vyskytují ve formátu Signed on 05/24/2016 (kde 05 označuje měsíc a 24 den). Rozhodneš se použít zachytávající skupiny k extrakci těchto informací a uložit je do samostatných proměnných.

Nejdřív si celý postup otestuješ na jednom příkladu.

Proměnná contract obsahující text jedné smlouvy a modul re jsou v session už načteny. Data si můžeš prohlédnout pomocí print() v IPython Shellu.

Toto cvičení je součástí kurzu

Regular Expressions in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Write regex and scan contract to capture the dates described
regex_dates = r"____\s____\s(____)/(____)/(____)"
dates = re.____(____, ____)
Upravit a spustit kód