Začněte nyníZačněte zdarma

Sumarizace dat z Parquet souboru

Prvním reportem postaveným na Parquet souborech je přehled digitálních výpůjček, který tým sestavil v 1. kapitole – tentokrát ale s dotazem scan_parquet jako výchozím bodem. Postav stejný líný pipeline, aby ho tým mohl znovu použít při práci s archivem.

LazyFrame requests je už připravený z Parquet souboru.

Toto cvičení je součástí kurzu

Scaling and Optimizing Data Pipelines with Polars

Zobrazit kurz

Pokyny k cvičení

  • Filtruj requests tak, aby zůstaly pouze řádky, kde use má hodnotu "Digital".
  • Seskup filtrované řádky podle sloupce format.
  • Spusť pipeline až na jeho úplném konci.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

result = (
    requests
    # Filter to digital
    .filter(pl.col("use") == "____")
    # Group by format
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    # Trigger execution at the end
    .____()
)
print(result)
Upravit a spustit kód