НачатьНачать бесплатно

Запись очищенной выборки в Parquet

Вернёмся к данным библиотек Сиэтла. Команда подготовила очищенную выборку данных о выдаче книг и хочет записать её в Parquet для дальнейшей обработки, не загружая весь объём данных в память. Запишите результат ленивого запроса прямо на диск.

clean_checkouts уже загружен, как и путь для экспорта CLEAN_EXPORT_PATH.

Это упражнение является частью курса

Масштабирование и оптимизация конвейеров данных с Polars

Посмотреть курс

Инструкции к упражнению

  • Запишите clean_checkouts по пути CLEAN_EXPORT_PATH непосредственно из ленивого запроса.
  • Установите размер группы строк равным 5 000.
  • Используйте потоковый движок.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Write clean_checkouts straight to disk
clean_checkouts.____(
    CLEAN_EXPORT_PATH,
    # 5,000 rows per row group
    row_group_size=____,
    # Streaming engine
    engine="____",
)

# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
    pl.len().alias("rows"),
    pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)
Редактировать и запускать код