Odstraňování odlehlých hodnot na základě procent
Jedním ze způsobů, jak zabránit tomu, aby malá část dat nadměrně ovlivňovala výsledky, je odstranit určité procento největších nebo nejmenších hodnot ve sloupci. Toho dosáhneme tak, že najdeme příslušný kvantil a data pomocí něj ořežeme maskou. Tento přístup se hodí zejména tehdy, kdy chceš z analýzy vyloučit nejvyšší hodnoty v datasetu. Pamatuj ale, že i když dataset neobsahuje žádné odlehlé hodnoty, tato metoda stejně odstraní horních N procent dat.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Pokyny k cvičení
- Najdi 95. kvantil sloupce
ConvertedSalary. - Ořež DataFrame
so_numeric_dftak, aby obsahoval pouze řádky, kde jeConvertedSalarymenší než jeho 95. kvantil. - Vykresli histogram
so_numeric_df[['ConvertedSalary']]. - Vykresli histogram
trimmed_df[['ConvertedSalary']].
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)
# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]
# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()
# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()