Inserire colonne mancanti
Nel file estratto di un anno manca la colonna pub (publisher), ma il team vuole comunque scansionare entrambi i file come un unico insieme di dati. Scegli l'argomento corretto così che Polars inserisca null dove manca una colonna invece di andare in errore.
polars è caricato come pl e la directory è in DRIFT_DIR. L'intestazione di ciascun file è stampata per te, così puoi vedere la differenza di schema.
Questo esercizio fa parte del corso
Scalare e ottimizzare le pipeline di dati con Polars
Istruzioni dell'esercizio
- Usa un pattern glob per scansionare ogni file
seattle_*.csvinDRIFT_DIR. - Aggiungi l'argomento corretto così che Polars inserisca null per le colonne mancanti in alcuni file.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))