Undersampling trénovacích dat
Teď je řada na tobě – proveď undersampling trénovací sady pomocí několika řádků kódu z Pandas. Po dokončení undersamplingu si můžeš ověřit výsledky kontrolou počtu hodnot loan_status.
X_y_train, count_nondefault a count_default jsou již načteny v pracovním prostředí. Byly vytvořeny pomocí následujícího kódu:
X_y_train = pd.concat([X_train.reset_index(drop = True),
y_train.reset_index(drop = True)], axis = 1)
count_nondefault, count_default = X_y_train['loan_status'].value_counts()
Výsledek .value_counts() pro původní trénovací data se vypíše automaticky.
Toto cvičení je součástí kurzu
Credit Risk Modeling in Python
Pokyny k cvičení
- Vytvoř datové sady nedefaultů a defaultů a ulož je jako
nondefaultsadefaults. - Z
nondefaultsvyber náhodný vzorek o stejném počtu jakocount_defaulta ulož ho jakonondefaults_under. - Spoj
nondefaults_underadefaultspomocí.concat()a výsledek ulož jakoX_y_train_under. - Vypiš
.value_counts()stavu půjčky pro novou datovou sadu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create data sets for defaults and non-defaults
____ = ____[____[____] == 0]
____ = ____[____[____] == 1]
# Undersample the non-defaults
____ = nondefaults.sample(____)
# Concatenate the undersampled nondefaults with defaults
____ = pd.____([____.reset_index(drop = True),
____.reset_index(drop = True)], axis = 0)
# Print the value counts for loan status
print(____[____].____())