Undersampling danych treningowych
Czas samodzielnie przeprowadzić undersampling zbioru treningowego za pomocą kilku linii kodu z biblioteki Pandas. Po zakończeniu możesz sprawdzić liczebność wartości loan_status, żeby zweryfikować wyniki.
X_y_train, count_nondefault i count_default są już załadowane w środowisku roboczym. Zostały utworzone przy użyciu następującego kodu:
X_y_train = pd.concat([X_train.reset_index(drop = True),
y_train.reset_index(drop = True)], axis = 1)
count_nondefault, count_default = X_y_train['loan_status'].value_counts()
Wynik .value_counts() dla oryginalnych danych treningowych zostanie wyświetlony automatycznie.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w Pythonie
Instrukcje do ćwiczenia
- Utwórz zbiory danych dla przypadków niespłacenia i spłacenia, zapisując je jako
nondefaultsidefaults. - Pobierz próbkę z
nondefaultso liczebności równejcount_defaulti zapisz ją jakonondefaults_under. - Połącz
nondefaultsidefaultsza pomocą.concat()i zapisz wynik jakoX_y_train_under. - Wyświetl
.value_counts()statusu kredytu dla nowego zbioru danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create data sets for defaults and non-defaults
____ = ____[____[____] == 0]
____ = ____[____[____] == 1]
# Undersample the non-defaults
____ = nondefaults.sample(____)
# Concatenate the undersampled nondefaults with defaults
____ = pd.____([____.reset_index(drop = True),
____.reset_index(drop = True)], axis = 0)
# Print the value counts for loan status
print(____[____].____())