Агрегация данных из Parquet
Первый отчёт на основе Parquet — это сводка по цифровым выдачам, которую команда построила в главе 1, но теперь отправной точкой служит запрос scan_parquet. Создайте тот же ленивый конвейер, чтобы команда могла применять этот шаблон повторно при работе с архивом.
LazyFrame requests уже создан для вас на основе файла Parquet.
Это упражнение является частью курса
Масштабирование и оптимизация конвейеров данных с Polars
Инструкции к упражнению
- Отфильтруйте
requests, оставив только строки, гдеuseравно"Digital". - Сгруппируйте отфильтрованные строки по столбцу
format. - Запустите выполнение конвейера в самом конце.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
result = (
requests
# Filter to digital
.filter(pl.col("use") == "____")
# Group by format
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
# Trigger execution at the end
.____()
)
print(result)