ÎncepețiÎncepe gratuit

Subeșantionarea setului de antrenament

În video ai văzut că, pentru a depăși problema datelor dezechilibrate, poți folosi subeșantionarea sau supraesantionarea. Setul de antrenament a fost subeșantionat în prealabil, astfel încât 1/3 din acesta conține cazuri de neplată, iar 2/3 cazuri fără neplată. Setul de date rezultat este disponibil în spațiul tău de lucru sub numele undersampled_training_set și conține mai puține observații (6.570 în loc de 19.394). În acest exercițiu, vei construi un arbore de decizie folosind setul de date subeșantionat.

Vei observa că arborii din acest exercițiu și din cel următor sunt foarte mari – atât de mari, încât nu mai pot fi citiți cu ușurință. Nu te îngrijora deocamdată; în videoclipul următor îți vom arăta cum îi poți face mai ușor de gestionat!

Acest exercițiu face parte din cursul

Modelarea riscului de credit în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Pachetul rpart a fost instalat pentru tine. Încarcă pachetul în spațiul tău de lucru.
  • Modifică codul furnizat astfel încât arborele de decizie să fie construit folosind setul de antrenament subeșantionat în loc de training_set. În plus, adaugă argumentul control = rpart.control(cp = 0.001). cp, adică parametrul de complexitate, reprezintă pragul pentru o scădere a erorii globale la orice divizare. Dacă valoarea cp nu este atinsă, nu se mai realizează nicio divizare suplimentară. Valoarea implicită a cp este 0,01, însă pentru probleme complexe se recomandă relaxarea acestui parametru.
  • Reprezintă grafic arborele de decizie folosind funcția plot și numele obiectului arbore. Adaugă al doilea argument uniform = TRUE pentru a obține ramuri de dimensiuni egale.
  • Comanda anterioară creează un arbore cu noduri și muchii, dar fără niciun text (sau așa-numite „etichete"). Folosește funcția text() cu singurul argument tree_undersample pentru a adăuga etichete.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load package rpart in your workspace.


# Change the code provided in the video such that a decision tree is constructed using the undersampled training set. Include rpart.control to relax the complexity parameter to 0.001.
tree_undersample <- rpart(loan_status ~ ., method = "class",
                          data =  training_set)

# Plot the decision tree


# Add labels to the decision tree
Editează și rulează codul