CommencerCommencez gratuitement

Insérer les colonnes manquantes

Le fichier extrait d'une année ne contient pas la colonne pub (éditeur), mais l'équipe souhaite tout de même analyser les deux fichiers comme un seul jeu de données. Choisissez le bon argument pour que Polars insère null là où une colonne manque, au lieu d'échouer.

polars est importé sous le nom pl, et le répertoire est dans DRIFT_DIR. L'en-tête de chaque fichier est affiché pour vous, afin que vous puissiez voir la différence de schéma.

Cet exercice fait partie du cours

<cours>Mise à l'échelle et optimisation des pipelines de données avec Polars</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez un motif glob pour analyser tous les fichiers seattle_*.csv dans DRIFT_DIR.
  • Ajoutez l'argument approprié afin que Polars insère des valeurs nulles pour les colonnes manquantes dans certains fichiers.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
    str(DRIFT_DIR / "____"),
    try_parse_dates=True,
    # Insert missing columns instead of failing on schema differences
    ____="____",
)

result = combined.select("date", "format", "title", "pub").collect()

print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))
Modifier et exécuter le code