Insérer les colonnes manquantes
Le fichier extrait d'une année ne contient pas la colonne pub (éditeur), mais l'équipe souhaite tout de même analyser les deux fichiers comme un seul jeu de données. Choisissez le bon argument pour que Polars insère null là où une colonne manque, au lieu d'échouer.
polars est importé sous le nom pl, et le répertoire est dans DRIFT_DIR. L'en-tête de chaque fichier est affiché pour vous, afin que vous puissiez voir la différence de schéma.
Cet exercice fait partie du cours
<cours>Mise à l'échelle et optimisation des pipelines de données avec Polars</cours>Instructions de l’exercice
- Utilisez un motif glob pour analyser tous les fichiers
seattle_*.csvdansDRIFT_DIR. - Ajoutez l'argument approprié afin que Polars insère des valeurs nulles pour les colonnes manquantes dans certains fichiers.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))