Kom igångKom igång gratis

Skanna ett hive-partitionerat dataset

Teamet lagrar även städade Parquet-utlån i en hive-partitionerad struktur, med en katalog per år (checkoutyear=2023/, checkoutyear=2024/). Skanna det partitionerade datasetet och filtrera på partitionskolumnen så att Polars bara läser de år du faktiskt behöver.

polars är inläst som pl, och rotkatalogen finns i HIVE_DIR. Partitionskatalogerna skrivs ut åt dig så att du kan se strukturen.

Den här övningen är en del av kursen

Skalning och optimering av datapipelines med Polars

Visa kurs

Övningsinstruktioner

  • Skanna HIVE_DIR med rätt argument för att aktivera hive-partitionering.
  • Filtrera resultatet till utlån från 2024 och framåt.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

requests = pl.scan_parquet(
    HIVE_DIR,
    # Enable hive partitioning
    ____=True,
)

result = (
    requests
    # Filter to the 2024 partition
    .filter(pl.col("checkoutyear") >= ____)
    .group_by("format")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Redigera och kör kod