ÎncepețiÎncepe gratuit

Inserarea coloanelor lipsă

Fișierul extras pentru un anumit an nu conține coloana pub (editorul), dar echipa vrea totuși să scaneze ambele fișiere ca un singur set de date. Alege argumentul potrivit pentru ca Polars să insereze null acolo unde o coloană lipsește, în loc să returneze o eroare.

polars este încărcat ca pl, iar directorul se află în DRIFT_DIR. Antetul fiecărui fișier este afișat pentru tine, astfel încât să poți vedea diferența de schemă.

Acest exercițiu face parte din cursul

Scalarea și optimizarea pipeline-urilor de date cu Polars

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește un model glob pentru a scana fiecare fișier seattle_*.csv din DRIFT_DIR.
  • Adaugă argumentul potrivit pentru ca Polars să insereze valori nule pentru coloanele care lipsesc din unele fișiere.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
    str(DRIFT_DIR / "____"),
    try_parse_dates=True,
    # Insert missing columns instead of failing on schema differences
    ____="____",
)

result = combined.select("date", "format", "title", "pub").collect()

print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))
Editează și rulează codul