ÎncepețiÎncepe gratuit

Rezumarea datelor din fișiere Parquet

Primul raport bazat pe Parquet este sumarul achizițiilor digitale pe care echipa l-a construit în Capitolul 1, de data aceasta pornind de la o interogare scan_parquet. Construiește același pipeline lazy, astfel încât echipa să poată reutiliza acest șablon în întreaga arhivă.

LazyFrame-ul requests este deja construit pentru tine din fișierul Parquet.

Acest exercițiu face parte din cursul

Scalarea și optimizarea pipeline-urilor de date cu Polars

Vezi cursul

Instrucțiuni pentru exercițiu

  • Filtrează requests pentru rândurile în care use este "Digital".
  • Grupează rândurile filtrate după format.
  • Declanșează execuția la finalul pipeline-ului.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

result = (
    requests
    # Filter to digital
    .filter(pl.col("use") == "____")
    # Group by format
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    # Trigger execution at the end
    .____()
)
print(result)
Editează și rulează codul