Kom igångKom igång gratis

Sammanfatta Parquet-data

Den första Parquet-baserade rapporten är sammanfattningen av digitala utlån som teamet byggde i kapitel 1 – men nu med en scan_parquet-fråga som startpunkt. Bygg samma lazy-pipeline så att teamet kan återanvända mönstret i sitt arkiv.

LazyFrame:en requests är redan skapad åt dig från Parquet-filen.

Den här övningen är en del av kursen

Skalning och optimering av datapipelines med Polars

Visa kurs

Övningsinstruktioner

  • Filtrera requests till de rader där use är "Digital".
  • Gruppera de filtrerade raderna efter format.
  • Utlös exekvering i slutet av pipeline:n.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

result = (
    requests
    # Filter to digital
    .filter(pl.col("use") == "____")
    # Group by format
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    # Trigger execution at the end
    .____()
)
print(result)
Redigera och kör kod