Zacznij terazZacznij za darmo

Skanowanie wielu plików

Dane o wypożyczeniach są teraz podzielone na osobne pliki CSV — po jednym na rok (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Te pliki używają starych nazw kolumn: usageclass i materialtype. Skorzystaj ze wzorca glob, aby zeskanować wszystkie pliki razem jako jeden logiczny zbiór danych, a następnie przygotuj zestawienie wypożyczeń fizycznych.

polars jest załadowany jako pl, a ścieżka do katalogu jest dostępna pod zmienną MULTIFILE_DIR.

To ćwiczenie jest częścią kursu

Skalowanie i optymalizacja potoków danych w Polars

Zobacz kurs

Instrukcje do ćwiczenia

  • Zeskanuj wszystkie pliki seattle_*.csv w katalogu MULTIFILE_DIR, używając wzorca glob.
  • Odfiltruj połączony zbiór danych do wypożyczeń "Physical", a następnie pogrupuj według kolumny materialtype.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
    str(MULTIFILE_DIR / "____")
)

# Build a physical-checkout summary across the combined dataset
result = (
    yearly_checkouts
    # Filter to physical
    .filter(pl.col("usageclass") == "____")
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Edytuj i uruchom kod