Parsowanie plików PDF
Czas zająć się kolejnym małym projektem, który odkładałeś na później. Firma przekazała ci kilka plików PDF z podpisanymi umowami. Celem projektu jest stworzenie bazy danych z informacjami wyodrębnionymi z tych plików. Trzy kolumny powinny odpowiadać dniu, miesiącowi i rokowi podpisania umowy.
Daty mają format Signed on 05/24/2016 (05 oznacza miesiąc, 24 – dzień). Postanawiasz użyć grup przechwytujących, aby wyodrębnić te informacje, a następnie zapisać je osobno w różnych zmiennych.
Na początek wykonasz test koncepcji.
Zmienna contract zawierająca tekst jednej umowy oraz moduł re są już załadowane w sesji. Możesz użyć funkcji print(), aby wyświetlić dane w powłoce IPython.
To ćwiczenie jest częścią kursu
Wyrażenia regularne w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Write regex and scan contract to capture the dates described
regex_dates = r"____\s____\s(____)/(____)/(____)"
dates = re.____(____, ____)