Parquet-Daten zusammenfassen
Der erste Parquet-basierte Report ist die digitale Checkout-Zusammenfassung, die das Team in Kapitel 1 gebaut hat – jetzt aber ausgehend von einer scan_parquet-Abfrage. Baue dieselbe lazy Pipeline, damit das Team dieses Muster im gesamten Archiv wiederverwenden kann.
Das LazyFrame requests wurde bereits für dich aus der Parquet-Datei erstellt.
Diese Übung ist Teil des Kurses
<Kurs>Skalieren und Optimieren von Data-Pipelines mit Polars</Kurs>Übungsanweisungen
- Filtere
requestsauf Zeilen, in denenuse"Digital"ist. - Gruppiere die gefilterten Zeilen nach
format. - Stoße die Ausführung ganz am Ende der Pipeline an.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
result = (
requests
# Filter to digital
.filter(pl.col("use") == "____")
# Group by format
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
# Trigger execution at the end
.____()
)
print(result)