Usuwanie wartości odstających na podstawie percentyli
Jednym ze sposobów na ograniczenie negatywnego wpływu niewielkiej części danych jest usunięcie określonego procentu największych i/lub najmniejszych wartości w kolumnie. Można to osiągnąć, wyznaczając odpowiedni kwantyl i przycinając dane za pomocą maski. To podejście sprawdza się szczególnie wtedy, gdy chcesz uniknąć skrajnie wysokich wartości w zbiorze danych. Pamiętaj jednak, że nawet jeśli w danych nie ma wartości odstających, ta metoda i tak usunie ten sam odsetek najwyższych wartości.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Wyznacz 95. kwantyl kolumny
ConvertedSalary. - Przytnij ramkę danych
so_numeric_df, zachowując tylko wiersze, w którychConvertedSalaryjest mniejsze od jej 95. kwantyla. - Narysuj histogram
so_numeric_df[['ConvertedSalary']]. - Narysuj histogram
trimmed_df[['ConvertedSalary']].
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)
# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]
# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()
# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()