Supprimer une liste de colonnes
Notre jeu de données est riche en variables, mais elles ne sont pas toutes utiles. Certaines seront difficiles à transformer en informations exploitables. Pour l’instant, supprimons les colonnes qui ne sont pas immédiatement pertinentes.
'STREETNUMBERNUMERIC': Le numéro d’adresse postale du logement'FIREPLACES': Nombre de cheminées dans le logement'LOTSIZEDIMENSIONS': Texte libre décrivant la forme du terrain'LISTTYPE': Liste prédéfinie des types de vente'ACRES': Surface du terrain en valeur numérique
Cet exercice fait partie du cours
<cours>Feature Engineering avec PySpark</cours>Instructions de l’exercice
- Lisez la liste des colonnes ci-dessus et explorez leurs 30 premières valeurs avec
show(). Le dataframe, déjà filtré sur ces colonnes, est disponible sous le nomdf. - Créez une liste de deux colonnes à supprimer, appelée
cols_to_drop, en vous basant sur leur manque de pertinence pour la prédiction des prix des maisons. Rappelez-vous que les ordinateurs n’interprètent explicitement que des nombres et ne comprennent pas le contexte. - Utilisez la fonction
drop()pour retirer du dataframedfles colonnes présentes dans la listecols_to_drop.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)