Wstawianie brakujących kolumn
W pliku wyodrębnionym z jednego roku brakuje kolumny pub (wydawca), ale zespół chce zeskanować oba pliki jako jeden zbiór danych. Wybierz właściwy argument, żeby Polars wstawiał null w miejscach brakujących kolumn zamiast zgłaszać błąd.
polars jest załadowany jako pl, a ścieżka do katalogu znajduje się w DRIFT_DIR. Nagłówek każdego pliku jest wyświetlany automatycznie, dzięki czemu widzisz różnicę w schematach.
To ćwiczenie jest częścią kursu
Skalowanie i optymalizacja potoków danych w Polars
Instrukcje do ćwiczenia
- Użyj wzorca glob, aby zeskanować każdy plik
seattle_*.csvwDRIFT_DIR. - Dodaj odpowiedni argument, żeby Polars wstawiał wartości null dla kolumn, których brakuje w niektórych plikach.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))