ÎncepețiÎncepe gratuit

Subeșantionarea datelor de antrenament

Este momentul să subeșantionezi setul de antrenament chiar tu, folosind câteva linii de cod din Pandas. După ce subeșantionarea este finalizată, poți verifica numărul de valori pentru loan_status și confirma rezultatele.

X_y_train, count_nondefault și count_default sunt deja încărcate în spațiul de lucru. Ele au fost create folosind următorul cod:

X_y_train = pd.concat([X_train.reset_index(drop = True),
                       y_train.reset_index(drop = True)], axis = 1)
count_nondefault, count_default = X_y_train['loan_status'].value_counts()

Rezultatele .value_counts() pentru datele de antrenament originale vor fi afișate automat.

Acest exercițiu face parte din cursul

Modelarea Riscului de Credit în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează seturi de date pentru cazurile fără nerambursare și cu nerambursare, stocate ca nondefaults, respectiv defaults.
  • Eșantionează nondefaults la același număr ca count_default și stochează rezultatul ca nondefaults_under.
  • Concatenează nondefaults și defaults folosind .concat() și stochează rezultatul ca X_y_train_under.
  • Afișează .value_counts() pentru statusul creditului din noul set de date.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create data sets for defaults and non-defaults
____ = ____[____[____] == 0]
____ = ____[____[____] == 1]

# Undersample the non-defaults
____ = nondefaults.sample(____)

# Concatenate the undersampled nondefaults with defaults
____ = pd.____([____.reset_index(drop = True),
                             ____.reset_index(drop = True)], axis = 0)

# Print the value counts for loan status
print(____[____].____())
Editează și rulează codul