Podsumowanie danych z pliku Parquet
Pierwszy raport oparty na Parquecie to zestawienie wypożyczeń cyfrowych, które zespół zbudował w rozdziale 1 — tym razem jednak jako punkt wyjścia służy zapytanie scan_parquet. Zbuduj ten sam potok lazy, aby zespół mógł ponownie wykorzystywać ten wzorzec w całym archiwum.
LazyFrame requests jest już dla ciebie gotowy — pochodzi z pliku Parquet.
To ćwiczenie jest częścią kursu
Skalowanie i optymalizacja potoków danych w Polars
Instrukcje do ćwiczenia
- Odfiltruj wiersze z
requests, w którychusema wartość"Digital". - Pogrupuj przefiltrowane wiersze według kolumny
format. - Uruchom wykonanie potoku na samym jego końcu.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
result = (
requests
# Filter to digital
.filter(pl.col("use") == "____")
# Group by format
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
# Trigger execution at the end
.____()
)
print(result)