Začněte nyníZačněte zdarma

Undersampling trénovacích dat

Teď je řada na tobě – proveď undersampling trénovací sady pomocí několika řádků kódu z Pandas. Po dokončení undersamplingu si můžeš ověřit výsledky kontrolou počtu hodnot loan_status.

X_y_train, count_nondefault a count_default jsou již načteny v pracovním prostředí. Byly vytvořeny pomocí následujícího kódu:

X_y_train = pd.concat([X_train.reset_index(drop = True),
                       y_train.reset_index(drop = True)], axis = 1)
count_nondefault, count_default = X_y_train['loan_status'].value_counts()

Výsledek .value_counts() pro původní trénovací data se vypíše automaticky.

Toto cvičení je součástí kurzu

Credit Risk Modeling in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř datové sady nedefaultů a defaultů a ulož je jako nondefaults a defaults.
  • Z nondefaults vyber náhodný vzorek o stejném počtu jako count_default a ulož ho jako nondefaults_under.
  • Spoj nondefaults_under a defaults pomocí .concat() a výsledek ulož jako X_y_train_under.
  • Vypiš .value_counts() stavu půjčky pro novou datovou sadu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create data sets for defaults and non-defaults
____ = ____[____[____] == 0]
____ = ____[____[____] == 1]

# Undersample the non-defaults
____ = nondefaults.sample(____)

# Concatenate the undersampled nondefaults with defaults
____ = pd.____([____.reset_index(drop = True),
                             ____.reset_index(drop = True)], axis = 0)

# Print the value counts for loan status
print(____[____].____())
Upravit a spustit kód