Skanowanie wielu plików
Dane o wypożyczeniach są teraz podzielone na osobne pliki CSV — po jednym na rok (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Te pliki używają starych nazw kolumn: usageclass i materialtype. Skorzystaj ze wzorca glob, aby zeskanować wszystkie pliki razem jako jeden logiczny zbiór danych, a następnie przygotuj zestawienie wypożyczeń fizycznych.
polars jest załadowany jako pl, a ścieżka do katalogu jest dostępna pod zmienną MULTIFILE_DIR.
To ćwiczenie jest częścią kursu
Skalowanie i optymalizacja potoków danych w Polars
Instrukcje do ćwiczenia
- Zeskanuj wszystkie pliki
seattle_*.csvw kataloguMULTIFILE_DIR, używając wzorca glob. - Odfiltruj połączony zbiór danych do wypożyczeń
"Physical", a następnie pogrupuj według kolumnymaterialtype.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)