CommencezCommencez gratuitement

Retrait des valeurs aberrantes selon un pourcentage

Une façon de s'assurer qu'une petite portion des données n'ait pas un effet trop négatif consiste à retirer un certain pourcentage des valeurs les plus grandes et/ou les plus petites de la colonne. Pour ce faire, trouvez le quantile pertinent, puis rogne(z) les données à l'aide d'un masque. Cette approche est particulièrement utile si vous craignez que les plus grandes valeurs de votre jeu de données doivent être écartées. Lorsque vous utilisez cette approche, gardez en tête que même en l'absence de valeurs aberrantes, elle retirera tout de même le même pourcentage supérieur N du jeu de données.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Trouvez le 95e quantile de la colonne ConvertedSalary.
  • Rognez le DataFrame so_numeric_df pour conserver toutes les lignes où ConvertedSalary est inférieur à son 95e quantile.
  • Tracez l'histogramme de so_numeric_df[['ConvertedSalary']].
  • Tracez l'histogramme de trimmed_df[['ConvertedSalary']].

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)

# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]

# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()

# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()
Modifier et exécuter le code