Skanna ett hive-partitionerat dataset
Teamet lagrar även städade Parquet-utlån i en hive-partitionerad struktur, med en katalog per år (checkoutyear=2023/, checkoutyear=2024/). Skanna det partitionerade datasetet och filtrera på partitionskolumnen så att Polars bara läser de år du faktiskt behöver.
polars är inläst som pl, och rotkatalogen finns i HIVE_DIR. Partitionskatalogerna skrivs ut åt dig så att du kan se strukturen.
Den här övningen är en del av kursen
Skalning och optimering av datapipelines med Polars
Övningsinstruktioner
- Skanna
HIVE_DIRmed rätt argument för att aktivera hive-partitionering. - Filtrera resultatet till utlån från 2024 och framåt.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
requests = pl.scan_parquet(
HIVE_DIR,
# Enable hive partitioning
____=True,
)
result = (
requests
# Filter to the 2024 partition
.filter(pl.col("checkoutyear") >= ____)
.group_by("format")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)