Začněte nyníZačněte zdarma

Skenování hive-partitioned datasetu

Tým také ukládá vyčištěné Parquet záznamy výpůjček v hive-partitioned struktuře – jeden adresář na rok (checkoutyear=2023/, checkoutyear=2024/). Naskenuj partitioned dataset a filtruj podle partition sloupce, aby Polars načetl jen roky, které skutečně potřebuješ.

polars je načtený jako pl a kořenový adresář je uložený v HIVE_DIR. Adresáře partition jsou vypsané, abys viděl/a, jak je struktura uspořádaná.

Toto cvičení je součástí kurzu

Scaling and Optimizing Data Pipelines with Polars

Zobrazit kurz

Pokyny k cvičení

  • Naskenuj HIVE_DIR se správným argumentem pro povolení hive partitioning.
  • Vyfiltruj výsledek na výpůjčky od roku 2024 včetně.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

requests = pl.scan_parquet(
    HIVE_DIR,
    # Enable hive partitioning
    ____=True,
)

result = (
    requests
    # Filter to the 2024 partition
    .filter(pl.col("checkoutyear") >= ____)
    .group_by("format")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Upravit a spustit kód