Kom igångKom igång gratis

Avvikande värden

Nu är det dags att undersöka strukturen hos variabeln age. Ett histogram visas till höger. På liknande sätt som du såg i videon för årsinkomst (annual_inc) finns det mycket tomt utrymme på höger sida av diagrammet. Det är en indikation på möjliga avvikande värden. Du ska titta på ett spridningsdiagram för att bekräfta detta. Om du hittar några avvikande värden tar du bort dem.

Om avvikande värden förekommer i flera variabler kan det vara användbart att titta på bivariata diagram. Det är möjligt att de avvikande värdena tillhör samma observation. I så fall finns det ännu mer anledning att ta bort observationen, eftersom det är mer troligt att någon information i den är felaktig.

Den här övningen är en del av kursen

Kreditriskmodellering i R

Visa kurs

Övningsinstruktioner

  • Skapa ett spridningsdiagram för variabeln age (via loan_data$age) med hjälp av funktionen plot(). Ge y-axeln den lämpliga etiketten "Age" med ylab som andra argument.
  • Den äldsta personen i den här datamängden är äldre än 122 år! Hämta indexet för det avvikande värdet med which() och använd åldern 122 som gränsvärde (du kan göra det med loan_data$age > 122). Tilldela resultatet till objektet index_highage.
  • Skapa en ny datamängd new_data efter att ha tagit bort observationen med den höga åldern med hjälp av objektet index_highage.
  • Titta på det bivariata spridningsdiagrammet med ålder på x-axeln och årsinkomst på y-axeln. Ändra etiketterna till "Age" respektive "Annual Income".

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Plot the age variable


# Save the outlier's index to index_highage


# Create data set new_data with outlier deleted
new_data <- loan_data[-___, ]

# Make bivariate scatterplot of age and annual income
plot(loan_data$age, loan_data$annual_inc, xlab = "___", ylab = "___")
Redigera och kör kod