Zacznij terazZacznij za darmo

Parsowanie plików PDF

Czas zająć się kolejnym małym projektem, który odkładałeś na później. Firma przekazała ci kilka plików PDF z podpisanymi umowami. Celem projektu jest stworzenie bazy danych z informacjami wyodrębnionymi z tych plików. Trzy kolumny powinny odpowiadać dniu, miesiącowi i rokowi podpisania umowy.
Daty mają format Signed on 05/24/2016 (05 oznacza miesiąc, 24 – dzień). Postanawiasz użyć grup przechwytujących, aby wyodrębnić te informacje, a następnie zapisać je osobno w różnych zmiennych.

Na początek wykonasz test koncepcji.

Zmienna contract zawierająca tekst jednej umowy oraz moduł re są już załadowane w sesji. Możesz użyć funkcji print(), aby wyświetlić dane w powłoce IPython.

To ćwiczenie jest częścią kursu

Wyrażenia regularne w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Write regex and scan contract to capture the dates described
regex_dates = r"____\s____\s(____)/(____)/(____)"
dates = re.____(____, ____)
Edytuj i uruchom kod