Začněte nyníZačněte zdarma

Odstraňování odlehlých hodnot na základě procent

Jedním ze způsobů, jak zabránit tomu, aby malá část dat nadměrně ovlivňovala výsledky, je odstranit určité procento největších nebo nejmenších hodnot ve sloupci. Toho dosáhneme tak, že najdeme příslušný kvantil a data pomocí něj ořežeme maskou. Tento přístup se hodí zejména tehdy, kdy chceš z analýzy vyloučit nejvyšší hodnoty v datasetu. Pamatuj ale, že i když dataset neobsahuje žádné odlehlé hodnoty, tato metoda stejně odstraní horních N procent dat.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Pokyny k cvičení

  • Najdi 95. kvantil sloupce ConvertedSalary.
  • Ořež DataFrame so_numeric_df tak, aby obsahoval pouze řádky, kde je ConvertedSalary menší než jeho 95. kvantil.
  • Vykresli histogram so_numeric_df[['ConvertedSalary']].
  • Vykresli histogram trimmed_df[['ConvertedSalary']].

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)

# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]

# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()

# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()
Upravit a spustit kód