LoslegenKostenlos starten

PDF-Dateien parsen

Jetzt musst du an einem weiteren kleinen Projekt arbeiten, das du aufgeschoben hast. Deine Firma hat dir einige PDF-Dateien mit unterschriebenen Verträgen gegeben. Ziel des Projekts ist es, eine Datenbank mit den Informationen zu erstellen, die du daraus extrahierst. Drei dieser Spalten sollen dem Tag, dem Monat und dem Jahr entsprechen, an dem der Vertrag unterschrieben wurde.
Die Datumsangaben erscheinen als Signed on 05/24/2016 (05 ist der Monat, 24 der Tag). Du entscheidest dich, Capturing Groups zu verwenden, um diese Informationen zu extrahieren. Außerdem möchtest du diese Informationen abrufen, damit du sie getrennt in verschiedenen Variablen speichern kannst.

Du startest mit einem Proof of Concept.

Die Variable contract mit dem Text eines Vertrags und das Modul re sind bereits in deiner Sitzung geladen. Du kannst print() verwenden, um die Daten in der IPython Shell anzuzeigen.

Diese Übung ist Teil des Kurses

<Kurs>Reguläre Ausdrücke in Python</Kurs>
Kurs ansehen

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Write regex and scan contract to capture the dates described
regex_dates = r"____\s____\s(____)/(____)/(____)"
dates = re.____(____, ____)
Code bearbeiten und ausführen