Zachování chybějících hodnot
V některých situacích je samotný fakt, že vstupní hodnota chybí, důležitou informací. Hodnoty NA lze pomocí hrubé klasifikace zařadit do samostatné kategorie „chybějící".
Hrubá klasifikace ti umožní data zjednodušit a zlepšit interpretovatelnost modelu. Spočívá v tom, že hodnoty seskupíš do binů pokrývajících určité rozsahy. Tuto techniku lze využít i k tomu, aby všechny hodnoty NA dostaly vlastní bin.
Ve videu jsme si hrubou klasifikaci ukázali na příkladu délky zaměstnání. Kód z tohoto příkladu je reprodukován v R skriptu vpravo a lze ho upravit pro hrubou klasifikaci proměnné int_rate.
Toto cvičení je součástí kurzu
Modelování kreditního rizika v R
Pokyny k cvičení
- Uprav poskytnutý kód tak, aby hrubě klasifikoval proměnnou
int_rate, a výsledek ulož do nové proměnnéir_cat.- Nejprve nahraď všechny výskyty
loan_data$emp_catzaloan_data$ir_cata všechny výskytyloan_data$emp_lengthzaloan_data$int_rate. - Poté nastav biny na kategorie
"0-8","8-11","11-13.5"a"13.5+"(místo původních"0-15","15-30","30-45"a"45+"). Použití operátorů>a<=zůstává stejné jako ve videu. Nezapomeň také změnit čísla v podmínkách (15, 30 a 45 nahraď hodnotami 8, 11 a 13,5).
- Nejprve nahraď všechny výskyty
- Zobraz novou proměnnou
ir_catpomocíplot(loan_data$ir_cat).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Make the necessary replacements in the coarse classification example below
loan_data$emp_cat <- rep(NA, length(loan_data$emp_length))
loan_data$emp_cat[which(loan_data$emp_length <= 15)] <- "0-15"
loan_data$emp_cat[which(loan_data$emp_length > 15 & loan_data$emp_length <= 30)] <- "15-30"
loan_data$emp_cat[which(loan_data$emp_length > 30 & loan_data$emp_length <= 45)] <- "30-45"
loan_data$emp_cat[which(loan_data$emp_length > 45)] <- "45+"
loan_data$emp_cat[which(is.na(loan_data$emp_length))] <- "Missing"
loan_data$emp_cat <- as.factor(loan_data$emp_cat)
# Look at your new variable using plot()