Sammanfatta Parquet-data
Den första Parquet-baserade rapporten är sammanfattningen av digitala utlån som teamet byggde i kapitel 1 – men nu med en scan_parquet-fråga som startpunkt. Bygg samma lazy-pipeline så att teamet kan återanvända mönstret i sitt arkiv.
LazyFrame:en requests är redan skapad åt dig från Parquet-filen.
Den här övningen är en del av kursen
Skalning och optimering av datapipelines med Polars
Övningsinstruktioner
- Filtrera
requeststill de rader däruseär"Digital". - Gruppera de filtrerade raderna efter
format. - Utlös exekvering i slutet av pipeline:n.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
result = (
requests
# Filter to digital
.filter(pl.col("use") == "____")
# Group by format
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
# Trigger execution at the end
.____()
)
print(result)