Subeșantionarea datelor de antrenament
Este momentul să subeșantionezi setul de antrenament chiar tu, folosind câteva linii de cod din Pandas. După ce subeșantionarea este finalizată, poți verifica numărul de valori pentru loan_status și confirma rezultatele.
X_y_train, count_nondefault și count_default sunt deja încărcate în spațiul de lucru. Ele au fost create folosind următorul cod:
X_y_train = pd.concat([X_train.reset_index(drop = True),
y_train.reset_index(drop = True)], axis = 1)
count_nondefault, count_default = X_y_train['loan_status'].value_counts()
Rezultatele .value_counts() pentru datele de antrenament originale vor fi afișate automat.
Acest exercițiu face parte din cursul
Modelarea Riscului de Credit în Python
Instrucțiuni pentru exercițiu
- Creează seturi de date pentru cazurile fără nerambursare și cu nerambursare, stocate ca
nondefaults, respectivdefaults. - Eșantionează
nondefaultsla același număr cacount_defaultși stochează rezultatul canondefaults_under. - Concatenează
nondefaultsșidefaultsfolosind.concat()și stochează rezultatul caX_y_train_under. - Afișează
.value_counts()pentru statusul creditului din noul set de date.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create data sets for defaults and non-defaults
____ = ____[____[____] == 0]
____ = ____[____[____] == 1]
# Undersample the non-defaults
____ = nondefaults.sample(____)
# Concatenate the undersampled nondefaults with defaults
____ = pd.____([____.reset_index(drop = True),
____.reset_index(drop = True)], axis = 0)
# Print the value counts for loan status
print(____[____].____())