Сканування набору даних із hive-партиціюванням
Команда також зберігає очищені Parquet-файли про видачі у форматі з hive-партиціюванням: один каталог на рік (checkoutyear=2023/, checkoutyear=2024/). Проскануйте розділений на партиції набір даних і відфільтруйте за стовпцем партиції так, щоб Polars читав лише ті роки, які вам справді потрібні.
polars імпортовано як pl, а кореневий каталог збережено в HIVE_DIR. Каталоги партицій уже надруковано для вас, щоб ви бачили структуру.
Ця вправа є частиною курсу
Масштабування й оптимізація конвеєрів даних з Polars
Інструкції до вправи
- Проскануйте
HIVE_DIR, використавши відповідний аргумент для увімкнення hive-партиціювання. - Відфільтруйте результат до видач починаючи з 2024 року.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
requests = pl.scan_parquet(
HIVE_DIR,
# Enable hive partitioning
____=True,
)
result = (
requests
# Filter to the 2024 partition
.filter(pl.col("checkoutyear") >= ____)
.group_by("format")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)