ПочатиПочніть безкоштовно

Сканування набору даних із hive-партиціюванням

Команда також зберігає очищені Parquet-файли про видачі у форматі з hive-партиціюванням: один каталог на рік (checkoutyear=2023/, checkoutyear=2024/). Проскануйте розділений на партиції набір даних і відфільтруйте за стовпцем партиції так, щоб Polars читав лише ті роки, які вам справді потрібні.

polars імпортовано як pl, а кореневий каталог збережено в HIVE_DIR. Каталоги партицій уже надруковано для вас, щоб ви бачили структуру.

Ця вправа є частиною курсу

Масштабування й оптимізація конвеєрів даних з Polars

Переглянути курс

Інструкції до вправи

  • Проскануйте HIVE_DIR, використавши відповідний аргумент для увімкнення hive-партиціювання.
  • Відфільтруйте результат до видач починаючи з 2024 року.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

requests = pl.scan_parquet(
    HIVE_DIR,
    # Enable hive partitioning
    ____=True,
)

result = (
    requests
    # Filter to the 2024 partition
    .filter(pl.col("checkoutyear") >= ____)
    .group_by("format")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Редагувати та запускати код