Tehnici de reesantionare
În exercițiul anterior, ai văzut cum dezechilibrul dintre clase poate influența rezultatele matricei de confuzie. În acest exercițiu, vei exersa tehnici de reeeșantionare pentru a explora efectele pe care diferite stiluri de reeeșantionare le pot avea asupra unui set de date cu dezechilibru de clase, precum loan_data. Folosind funcția resample() din sklearn, potrivirea numărului de rânduri cu clasa majoritară se numește supraeșantionare (upsampling), iar potrivirea cu clasa minoritară se numește subeșantionare (downsampling).
Vei crea atât o versiune supraeșantionată, cât și una subeșantionată a setului de date loan_data, vei aplica o regresie logistică pe fiecare dintre ele și vei evalua performanța. Datele de antrenament și etichetele corespunzătoare clasei deny sunt filtrate pentru a conține doar clasa minoritară, iar cele corespunzătoare clasei approve — clasa majoritară.
Un obiect de tip train/test split pentru generarea predicțiilor a fost salvat în spațiul de lucru ca X_test, disponibil pentru utilizare în exerciții.
Acest exercițiu face parte din cursul
Exersează întrebări de interviu pentru Machine Learning în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])
# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False, n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])