Запис очищеного витягу в Parquet
Повернімося до даних бібліотеки Сіетла. Команда має очищений витяг про видачі, який хоче записати у Parquet для подальших інструментів, але не хоче спершу матеріалізувати все в памʼяті. Запишіть ледачий запит одразу на диск.
clean_checkouts уже завантажено, як і шлях для експорту CLEAN_EXPORT_PATH.
Ця вправа є частиною курсу
Масштабування й оптимізація конвеєрів даних з Polars
Інструкції до вправи
- Запишіть
clean_checkoutsдоCLEAN_EXPORT_PATHбезпосередньо з ледачого запиту. - Встановіть розмір групи рядків 5 000.
- Використайте потоковий рушій.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Write clean_checkouts straight to disk
clean_checkouts.____(
CLEAN_EXPORT_PATH,
# 5,000 rows per row group
row_group_size=____,
# Streaming engine
engine="____",
)
# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
pl.len().alias("rows"),
pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)