Retrait des valeurs aberrantes selon un pourcentage
Une façon de s'assurer qu'une petite portion des données n'ait pas un effet trop négatif consiste à retirer un certain pourcentage des valeurs les plus grandes et/ou les plus petites de la colonne. Pour ce faire, trouvez le quantile pertinent, puis rogne(z) les données à l'aide d'un masque. Cette approche est particulièrement utile si vous craignez que les plus grandes valeurs de votre jeu de données doivent être écartées. Lorsque vous utilisez cette approche, gardez en tête que même en l'absence de valeurs aberrantes, elle retirera tout de même le même pourcentage supérieur N du jeu de données.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le Machine Learning en Python
Instructions de l’exercice
- Trouvez le 95e quantile de la colonne
ConvertedSalary. - Rognez le DataFrame
so_numeric_dfpour conserver toutes les lignes oùConvertedSalaryest inférieur à son 95e quantile. - Tracez l'histogramme de
so_numeric_df[['ConvertedSalary']]. - Tracez l'histogramme de
trimmed_df[['ConvertedSalary']].
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)
# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]
# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()
# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()