Borttagning av extremvärden med procentgränser
Ett sätt att förhindra att en liten del av datan påverkar analysen negativt är att ta bort en viss procentandel av de högsta och/eller lägsta värdena i kolumnen. Det gör du genom att beräkna relevant kvantil och sedan filtrera bort data med hjälp av en mask. Metoden är särskilt användbar om du vill undvika att de högsta värdena i din datamängd snedvrider resultaten. Tänk på att den här metoden alltid tar bort samma andel av de högsta värdena – även om det inte finns några egentliga extremvärden.
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Övningsinstruktioner
- Beräkna den 95:e kvantilen för kolumnen
ConvertedSalary. - Filtrera
so_numeric_dfså att enbart rader därConvertedSalaryär lägre än den 95:e kvantilen behålls. - Plotta ett histogram för
so_numeric_df[['ConvertedSalary']]. - Plotta ett histogram för
trimmed_df[['ConvertedSalary']].
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)
# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]
# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()
# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()