Skenování hive-partitioned datasetu
Tým také ukládá vyčištěné Parquet záznamy výpůjček v hive-partitioned struktuře – jeden adresář na rok (checkoutyear=2023/, checkoutyear=2024/). Naskenuj partitioned dataset a filtruj podle partition sloupce, aby Polars načetl jen roky, které skutečně potřebuješ.
polars je načtený jako pl a kořenový adresář je uložený v HIVE_DIR. Adresáře partition jsou vypsané, abys viděl/a, jak je struktura uspořádaná.
Toto cvičení je součástí kurzu
Scaling and Optimizing Data Pipelines with Polars
Pokyny k cvičení
- Naskenuj
HIVE_DIRse správným argumentem pro povolení hive partitioning. - Vyfiltruj výsledek na výpůjčky od roku 2024 včetně.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
requests = pl.scan_parquet(
HIVE_DIR,
# Enable hive partitioning
____=True,
)
result = (
requests
# Filter to the 2024 partition
.filter(pl.col("checkoutyear") >= ____)
.group_by("format")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)