LoslegenKostenlos starten

Parquet-Daten zusammenfassen

Der erste Parquet-basierte Report ist die digitale Checkout-Zusammenfassung, die das Team in Kapitel 1 gebaut hat – jetzt aber ausgehend von einer scan_parquet-Abfrage. Baue dieselbe lazy Pipeline, damit das Team dieses Muster im gesamten Archiv wiederverwenden kann.

Das LazyFrame requests wurde bereits für dich aus der Parquet-Datei erstellt.

Diese Übung ist Teil des Kurses

<Kurs>Skalieren und Optimieren von Data-Pipelines mit Polars</Kurs>
Kurs ansehen

Übungsanweisungen

  • Filtere requests auf Zeilen, in denen use "Digital" ist.
  • Gruppiere die gefilterten Zeilen nach format.
  • Stoße die Ausführung ganz am Ende der Pipeline an.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

result = (
    requests
    # Filter to digital
    .filter(pl.col("use") == "____")
    # Group by format
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    # Trigger execution at the end
    .____()
)
print(result)
Code bearbeiten und ausführen