CommencezCommencez gratuitement

Supprimer des lignes

Quand vous savez qu'une colonne précise sera essentielle à votre analyse et qu'une faible proportion de lignes n'a pas de valeur dans cette colonne, il est souvent logique de retirer ces lignes de l'ensemble de données.

Dans ce cours, la colonne driver_gender sera essentielle à bon nombre de vos analyses. Comme seule une petite fraction des lignes n'a pas de valeur pour driver_gender, nous allons supprimer ces lignes de l'ensemble de données.

Cette activité fait partie du cours

Analyse de l'activité policière avec pandas

Voir le cours

Instructions de l’exercice

  • Comptez le nombre de valeurs manquantes dans chaque colonne.
  • Supprimez toutes les lignes dont la valeur driver_gender est manquante en passant le nom de la colonne au paramètre subset de .dropna().
  • Recomptez le nombre de valeurs manquantes dans chaque colonne pour vérifier qu'aucune des lignes restantes n'a de valeur manquante pour driver_gender.
  • Examinez l'attribut .shape du DataFrame pour voir combien de lignes et de colonnes demeurent.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Count the number of missing values in each column
print(ri.isnull().____)

# Drop all rows that are missing 'driver_gender'
ri.____(subset=[____], inplace=True)

# Count the number of missing values in each column (again)
print(ri.____.____)

# Examine the shape of the DataFrame
print(____)
Modifier et exécuter le code