Kom igångKom igång gratis

Borttagning av extremvärden med procentgränser

Ett sätt att förhindra att en liten del av datan påverkar analysen negativt är att ta bort en viss procentandel av de högsta och/eller lägsta värdena i kolumnen. Det gör du genom att beräkna relevant kvantil och sedan filtrera bort data med hjälp av en mask. Metoden är särskilt användbar om du vill undvika att de högsta värdena i din datamängd snedvrider resultaten. Tänk på att den här metoden alltid tar bort samma andel av de högsta värdena – även om det inte finns några egentliga extremvärden.

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Beräkna den 95:e kvantilen för kolumnen ConvertedSalary.
  • Filtrera so_numeric_df så att enbart rader där ConvertedSalary är lägre än den 95:e kvantilen behålls.
  • Plotta ett histogram för so_numeric_df[['ConvertedSalary']].
  • Plotta ett histogram för trimmed_df[['ConvertedSalary']].

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)

# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]

# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()

# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()
Redigera och kör kod