Utforska kreditdata
Vi kommer att använda datamängden loan_data som presenterades i videon genom hela kursens övningar.
När du fått tillgång till loan_data är du särskilt intresserad av de lån som resulterat i fallissemang. Du vill få en bild av antalet och andelen fallissemang. Fallissemang är ovanliga, så det är alltid viktigt att kontrollera hur stor andel av lånen i en datamängd som utgörs av fallissemang. Funktionen CrossTable() är mycket användbar här.
Kom ihåg att information om fallissemang lagras i svarsvariabeln loan_status, där 1 representerar default (fallissemang) och 0 representerar non-default (inget fallissemang).
För att lära dig mer om variabelstrukturer och upptäcka oväntade mönster i data bör du undersöka sambandet mellan loan_status och vissa factor-variabler. Du skulle till exempel förvänta dig att andelen fallissemang bland kunder med kreditbetyg grade G (lägsta kreditbetyg) är betydligt högre än andelen fallissemang i gruppen grade A (högsta kreditbetyg).
CrossTable() kan även tillämpas på två kategoriska variabler. Låt oss undersöka det!
Den här övningen är en del av kursen
Kreditriskmodellering i R
Övningsinstruktioner
- Bekanta dig med datamängden genom att undersöka dess struktur med
str(). - Läs in paketet gmodels med
library(). Det är redan installerat på DataCamps servrar. - Skapa en
CrossTable()över lånestatus med bara ett argument:loan_data$loan_status. - Anropa
CrossTable()med argumentetxsatt tillloan_data$gradeoch argumentetysatt tillloan_data$loan_status. Vi vill bara visa radvis proportioner, så sättprop.rtillTRUE, menprop.c,prop.tochprop.chisqtillFALSE(standardvärdena ärTRUE, vilket skulle inkludera kolumnproportioner, tabellproportioner och chi-kvadratbidrag för varje cell – det behöver vi inte här).
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# View the structure of loan_data
# Load the gmodels package
# Call CrossTable() on loan_status
# Call CrossTable() on grade and loan_status