CommencezCommencez gratuitement

Supprimer une liste de colonnes

Notre ensemble de données contient beaucoup de caractéristiques, mais elles ne sont pas toutes pertinentes. Plusieurs seront difficiles à transformer en information utile. Pour l'instant, retirons les colonnes qui ne sont pas immédiatement utiles en les supprimant.

  • 'STREETNUMBERNUMERIC' : Le numéro de l'adresse postale de la propriété
  • 'FIREPLACES' : Nombre de foyers dans la propriété
  • 'LOTSIZEDIMENSIONS' : Texte libre décrivant la forme du terrain
  • 'LISTTYPE' : Ensemble de valeurs prédéfinies pour le type de vente
  • 'ACRES' : Superficie numérique du terrain

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • Lisez la liste des descriptions de colonnes ci-dessus et explorez leurs 30 premières valeurs avec show(). Le dataframe est déjà filtré aux colonnes indiquées sous le nom df.
  • Créez une liste de deux colonnes à supprimer, appelée cols_to_drop, en fonction de leur manque de pertinence pour la prédiction du prix des maisons. Rappelez-vous que les ordinateurs n'interprètent explicitement que des nombres et ne comprennent pas le contexte.
  • Utilisez la fonction drop() pour retirer du dataframe df les colonnes de la liste cols_to_drop.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
Modifier et exécuter le code