Zacznij terazZacznij za darmo

Podsumowanie danych z pliku Parquet

Pierwszy raport oparty na Parquecie to zestawienie wypożyczeń cyfrowych, które zespół zbudował w rozdziale 1 — tym razem jednak jako punkt wyjścia służy zapytanie scan_parquet. Zbuduj ten sam potok lazy, aby zespół mógł ponownie wykorzystywać ten wzorzec w całym archiwum.

LazyFrame requests jest już dla ciebie gotowy — pochodzi z pliku Parquet.

To ćwiczenie jest częścią kursu

Skalowanie i optymalizacja potoków danych w Polars

Zobacz kurs

Instrukcje do ćwiczenia

  • Odfiltruj wiersze z requests, w których use ma wartość "Digital".
  • Pogrupuj przefiltrowane wiersze według kolumny format.
  • Uruchom wykonanie potoku na samym jego końcu.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

result = (
    requests
    # Filter to digital
    .filter(pl.col("use") == "____")
    # Group by format
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    # Trigger execution at the end
    .____()
)
print(result)
Edytuj i uruchom kod