Avvikande värden
Nu är det dags att undersöka strukturen hos variabeln age. Ett histogram visas till höger. På liknande sätt som du såg i videon för årsinkomst (annual_inc) finns det mycket tomt utrymme på höger sida av diagrammet. Det är en indikation på möjliga avvikande värden. Du ska titta på ett spridningsdiagram för att bekräfta detta. Om du hittar några avvikande värden tar du bort dem.
Om avvikande värden förekommer i flera variabler kan det vara användbart att titta på bivariata diagram. Det är möjligt att de avvikande värdena tillhör samma observation. I så fall finns det ännu mer anledning att ta bort observationen, eftersom det är mer troligt att någon information i den är felaktig.
Den här övningen är en del av kursen
Kreditriskmodellering i R
Övningsinstruktioner
- Skapa ett spridningsdiagram för variabeln
age(vialoan_data$age) med hjälp av funktionenplot(). Ge y-axeln den lämpliga etiketten"Age"medylabsom andra argument. - Den äldsta personen i den här datamängden är äldre än 122 år! Hämta indexet för det avvikande värdet med which() och använd åldern 122 som gränsvärde (du kan göra det med
loan_data$age > 122). Tilldela resultatet till objektetindex_highage. - Skapa en ny datamängd
new_dataefter att ha tagit bort observationen med den höga åldern med hjälp av objektetindex_highage. - Titta på det bivariata spridningsdiagrammet med ålder på x-axeln och årsinkomst på y-axeln. Ändra etiketterna till
"Age"respektive"Annual Income".
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Plot the age variable
# Save the outlier's index to index_highage
# Create data set new_data with outlier deleted
new_data <- loan_data[-___, ]
# Make bivariate scatterplot of age and annual income
plot(loan_data$age, loan_data$annual_inc, xlab = "___", ylab = "___")