Scanarea unui set de date partiționat hive
Echipa stochează și fișiere Parquet de checkout curățate într-un layout partiționat hive, cu câte un director pentru fiecare an (checkoutyear=2023/, checkoutyear=2024/). Scanează setul de date partiționat și filtrează după coloana de partiție, astfel încât Polars să citească doar anii de care ai nevoie.
polars este încărcat ca pl, iar directorul rădăcină se află în HIVE_DIR. Directoarele de partiție sunt afișate pentru tine, ca să poți vedea structura.
Acest exercițiu face parte din cursul
Scalarea și optimizarea pipeline-urilor de date cu Polars
Instrucțiuni pentru exercițiu
- Scanează
HIVE_DIRfolosind argumentul potrivit pentru a activa partiționarea hive. - Filtrează rezultatul pentru a păstra doar checkout-urile din 2024 încoace.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
requests = pl.scan_parquet(
HIVE_DIR,
# Enable hive partitioning
____=True,
)
result = (
requests
# Filter to the 2024 partition
.filter(pl.col("checkoutyear") >= ____)
.group_by("format")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)