Průzkum úvěrových dat
V průběhu cvičení v tomto kurzu budeme pracovat s datasetem loan_data, o kterém jsi se dozvěděl/a ve videu.
Zajímají tě zejména nesplacené úvěry v tomto datasetu. Chceš získat přehled o jejich počtu a procentuálním podílu. Defaulty jsou vzácné, takže je vždy dobré zkontrolovat, jaký je jejich podíl v datasetech úvěrů. Funkce CrossTable() je v tomto případě velmi užitečná.
Informace o defaultu je uložena v proměnné loan_status, kde 1 označuje default a 0 označuje non-default.
Abys lépe porozuměl/a struktuře proměnných a odhalil/a neočekávané vzory v datech, prozkoumej vztah mezi loan_status a určitými proměnnými typu factor. Dalo by se například očekávat, že podíl defaultů ve skupině zákazníků s ratingem grade G (nejhorší kreditní hodnocení) bude výrazně vyšší než podíl defaultů ve skupině grade A (nejlepší kreditní hodnocení).
Funkci CrossTable() lze přitom snadno použít i na dvě kategorické proměnné najednou. Pojďme to prozkoumat!
Toto cvičení je součástí kurzu
Modelování kreditního rizika v R
Pokyny k cvičení
- Seznám se s datasetem tak, že se podíváš na jeho strukturu pomocí funkce
str(). - Načti balíček gmodels pomocí funkce
library(). Na serverech DataCampu je již nainstalován. - Prohlédni si
CrossTable()pro stav úvěru s jediným argumentem:loan_data$loan_status. - Zavolej
CrossTable()s argumentemxnastaveným naloan_data$gradea argumentemynastaveným naloan_data$loan_status. Chceme zobrazit pouze řádkové proporce, takže nastavprop.rnaTRUE, aleprop.c,prop.taprop.chisqnaFALSE(výchozí hodnoty jsouTRUE, což by vedlo k zahrnutí sloupcových proporcí, tabulkových proporcí a příspěvků chí-kvadrátu pro každou buňku – to zde nepotřebujeme).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# View the structure of loan_data
# Load the gmodels package
# Call CrossTable() on loan_status
# Call CrossTable() on grade and loan_status