Zacznij terazZacznij za darmo

Usuwanie wartości odstających na podstawie percentyli

Jednym ze sposobów na ograniczenie negatywnego wpływu niewielkiej części danych jest usunięcie określonego procentu największych i/lub najmniejszych wartości w kolumnie. Można to osiągnąć, wyznaczając odpowiedni kwantyl i przycinając dane za pomocą maski. To podejście sprawdza się szczególnie wtedy, gdy chcesz uniknąć skrajnie wysokich wartości w zbiorze danych. Pamiętaj jednak, że nawet jeśli w danych nie ma wartości odstających, ta metoda i tak usunie ten sam odsetek najwyższych wartości.

To ćwiczenie jest częścią kursu

Inżynieria cech w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyznacz 95. kwantyl kolumny ConvertedSalary.
  • Przytnij ramkę danych so_numeric_df, zachowując tylko wiersze, w których ConvertedSalary jest mniejsze od jej 95. kwantyla.
  • Narysuj histogram so_numeric_df[['ConvertedSalary']].
  • Narysuj histogram trimmed_df[['ConvertedSalary']].

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)

# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]

# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()

# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()
Edytuj i uruchom kod