Supprimer une liste de colonnes
Notre ensemble de données contient beaucoup de caractéristiques, mais elles ne sont pas toutes pertinentes. Plusieurs seront difficiles à transformer en information utile. Pour l'instant, retirons les colonnes qui ne sont pas immédiatement utiles en les supprimant.
'STREETNUMBERNUMERIC': Le numéro de l'adresse postale de la propriété'FIREPLACES': Nombre de foyers dans la propriété'LOTSIZEDIMENSIONS': Texte libre décrivant la forme du terrain'LISTTYPE': Ensemble de valeurs prédéfinies pour le type de vente'ACRES': Superficie numérique du terrain
Cette activité fait partie du cours
Ingénierie des caractéristiques avec PySpark
Instructions de l’exercice
- Lisez la liste des descriptions de colonnes ci-dessus et explorez leurs 30 premières valeurs avec
show(). Le dataframe est déjà filtré aux colonnes indiquées sous le nomdf. - Créez une liste de deux colonnes à supprimer, appelée
cols_to_drop, en fonction de leur manque de pertinence pour la prédiction du prix des maisons. Rappelez-vous que les ordinateurs n'interprètent explicitement que des nombres et ne comprennent pas le contexte. - Utilisez la fonction
drop()pour retirer du dataframedfles colonnes de la listecols_to_drop.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)