Zacznij terazZacznij za darmo

Wstawianie brakujących kolumn

W pliku wyodrębnionym z jednego roku brakuje kolumny pub (wydawca), ale zespół chce zeskanować oba pliki jako jeden zbiór danych. Wybierz właściwy argument, żeby Polars wstawiał null w miejscach brakujących kolumn zamiast zgłaszać błąd.

polars jest załadowany jako pl, a ścieżka do katalogu znajduje się w DRIFT_DIR. Nagłówek każdego pliku jest wyświetlany automatycznie, dzięki czemu widzisz różnicę w schematach.

To ćwiczenie jest częścią kursu

Skalowanie i optymalizacja potoków danych w Polars

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj wzorca glob, aby zeskanować każdy plik seattle_*.csv w DRIFT_DIR.
  • Dodaj odpowiedni argument, żeby Polars wstawiał wartości null dla kolumn, których brakuje w niektórych plikach.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
    str(DRIFT_DIR / "____"),
    try_parse_dates=True,
    # Insert missing columns instead of failing on schema differences
    ____="____",
)

result = combined.select("date", "format", "title", "pub").collect()

print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))
Edytuj i uruchom kod