Sumarizace dat z Parquet souboru
Prvním reportem postaveným na Parquet souborech je přehled digitálních výpůjček, který tým sestavil v 1. kapitole – tentokrát ale s dotazem scan_parquet jako výchozím bodem. Postav stejný líný pipeline, aby ho tým mohl znovu použít při práci s archivem.
LazyFrame requests je už připravený z Parquet souboru.
Toto cvičení je součástí kurzu
Scaling and Optimizing Data Pipelines with Polars
Pokyny k cvičení
- Filtruj
requeststak, aby zůstaly pouze řádky, kdeusemá hodnotu"Digital". - Seskup filtrované řádky podle sloupce
format. - Spusť pipeline až na jeho úplném konci.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
result = (
requests
# Filter to digital
.filter(pl.col("use") == "____")
# Group by format
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
# Trigger execution at the end
.____()
)
print(result)