Kodowanie one-hot danych kredytowych
Czas przygotować kolumny nienumeryczne, aby można je było dodać do modelu LogisticRegression().
Po utworzeniu nowych kolumn metodą one-hot encoding możesz połączyć je z kolumnami numerycznymi i stworzyć nową ramkę danych, która będzie używana w pozostałej części kursu do przewidywania prawdopodobieństwa niewywiązania się ze zobowiązań.
Pamiętaj, żeby kodowaniem one-hot objąć wyłącznie kolumny nienumeryczne. Zastosowanie go do kolumn numerycznych dałoby w efekcie niezwykle szeroki zbiór danych!
Dane kredytowe cr_loan_clean zostały już wczytane do środowiska pracy.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w Pythonie
Instrukcje do ćwiczenia
- Utwórz zbiór danych zawierający wszystkie kolumny numeryczne i nazwij go
cred_num, a zbiór z kolumnami nienumerycznymi nazwijcred_str. - Zastosuj kodowanie one-hot na
cred_str, aby utworzyć nowy zbiór danych o nazwiecred_str_onehot. - Połącz
cred_numz nowo zakodowanymi danymi one-hot i zapisz wynik jakocr_loan_prep. - Wyświetl kolumny nowego zbioru danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)