Insérer les colonnes manquantes
Le fichier extrait d'une année ne contient pas la colonne pub (éditeur), mais l'équipe souhaite quand même analyser les deux fichiers comme un seul jeu de données. Choisissez le bon argument pour que Polars insère null lorsque qu'une colonne est absente plutôt que d'échouer.
polars est importé sous pl, et le répertoire se trouve dans DRIFT_DIR. L'en-tête de chaque fichier est affiché pour vous afin que vous puissiez voir la différence de schéma.
Cette activité fait partie du cours
Mise à l'échelle et optimisation des pipelines de données avec Polars
Instructions de l’exercice
- Utilisez un motif glob pour analyser tous les fichiers
seattle_*.csvdansDRIFT_DIR. - Ajoutez l'argument approprié pour que Polars insère des valeurs nulles pour les colonnes manquantes dans certains fichiers.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))