Supprimer des lignes
Quand vous savez qu'une colonne précise sera essentielle à votre analyse et qu'une faible proportion de lignes n'a pas de valeur dans cette colonne, il est souvent logique de retirer ces lignes de l'ensemble de données.
Dans ce cours, la colonne driver_gender sera essentielle à bon nombre de vos analyses. Comme seule une petite fraction des lignes n'a pas de valeur pour driver_gender, nous allons supprimer ces lignes de l'ensemble de données.
Cette activité fait partie du cours
Analyse de l'activité policière avec pandas
Instructions de l’exercice
- Comptez le nombre de valeurs manquantes dans chaque colonne.
- Supprimez toutes les lignes dont la valeur
driver_genderest manquante en passant le nom de la colonne au paramètresubsetde.dropna(). - Recomptez le nombre de valeurs manquantes dans chaque colonne pour vérifier qu'aucune des lignes restantes n'a de valeur manquante pour
driver_gender. - Examinez l'attribut
.shapedu DataFrame pour voir combien de lignes et de colonnes demeurent.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Count the number of missing values in each column
print(ri.isnull().____)
# Drop all rows that are missing 'driver_gender'
ri.____(subset=[____], inplace=True)
# Count the number of missing values in each column (again)
print(ri.____.____)
# Examine the shape of the DataFrame
print(____)