ÎncepețiÎncepe gratuit

Scanarea unui set de date partiționat hive

Echipa stochează și fișiere Parquet de checkout curățate într-un layout partiționat hive, cu câte un director pentru fiecare an (checkoutyear=2023/, checkoutyear=2024/). Scanează setul de date partiționat și filtrează după coloana de partiție, astfel încât Polars să citească doar anii de care ai nevoie.

polars este încărcat ca pl, iar directorul rădăcină se află în HIVE_DIR. Directoarele de partiție sunt afișate pentru tine, ca să poți vedea structura.

Acest exercițiu face parte din cursul

Scalarea și optimizarea pipeline-urilor de date cu Polars

Vezi cursul

Instrucțiuni pentru exercițiu

  • Scanează HIVE_DIR folosind argumentul potrivit pentru a activa partiționarea hive.
  • Filtrează rezultatul pentru a păstra doar checkout-urile din 2024 încoace.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

requests = pl.scan_parquet(
    HIVE_DIR,
    # Enable hive partitioning
    ____=True,
)

result = (
    requests
    # Filter to the 2024 partition
    .filter(pl.col("checkoutyear") >= ____)
    .group_by("format")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Editează și rulează codul