CommencerCommencez gratuitement

Supprimer une liste de colonnes

Notre jeu de données est riche en variables, mais elles ne sont pas toutes utiles. Certaines seront difficiles à transformer en informations exploitables. Pour l’instant, supprimons les colonnes qui ne sont pas immédiatement pertinentes.

  • 'STREETNUMBERNUMERIC' : Le numéro d’adresse postale du logement
  • 'FIREPLACES' : Nombre de cheminées dans le logement
  • 'LOTSIZEDIMENSIONS' : Texte libre décrivant la forme du terrain
  • 'LISTTYPE' : Liste prédéfinie des types de vente
  • 'ACRES' : Surface du terrain en valeur numérique

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Lisez la liste des colonnes ci-dessus et explorez leurs 30 premières valeurs avec show(). Le dataframe, déjà filtré sur ces colonnes, est disponible sous le nom df.
  • Créez une liste de deux colonnes à supprimer, appelée cols_to_drop, en vous basant sur leur manque de pertinence pour la prédiction des prix des maisons. Rappelez-vous que les ordinateurs n’interprètent explicitement que des nombres et ne comprennent pas le contexte.
  • Utilisez la fonction drop() pour retirer du dataframe df les colonnes présentes dans la liste cols_to_drop.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
Modifier et exécuter le code