Inserarea coloanelor lipsă
Fișierul extras pentru un anumit an nu conține coloana pub (editorul), dar echipa vrea totuși să scaneze ambele fișiere ca un singur set de date. Alege argumentul potrivit pentru ca Polars să insereze null acolo unde o coloană lipsește, în loc să returneze o eroare.
polars este încărcat ca pl, iar directorul se află în DRIFT_DIR. Antetul fiecărui fișier este afișat pentru tine, astfel încât să poți vedea diferența de schemă.
Acest exercițiu face parte din cursul
Scalarea și optimizarea pipeline-urilor de date cu Polars
Instrucțiuni pentru exercițiu
- Folosește un model glob pentru a scana fiecare fișier
seattle_*.csvdinDRIFT_DIR. - Adaugă argumentul potrivit pentru ca Polars să insereze valori nule pentru coloanele care lipsesc din unele fișiere.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))