Codificare one-hot pentru datele de credit
E momentul să pregătești coloanele non-numerice pentru a le putea adăuga în modelul LogisticRegression().
După ce noile coloane sunt create prin codificare one-hot, le poți concatena cu coloanele numerice pentru a obține un nou DataFrame. Acesta va fi folosit pe parcursul restului cursului pentru a prezice probabilitatea de nerambursare.
Reține să aplici codificarea one-hot doar pe coloanele non-numerice. Dacă ai face asta și pe coloanele numerice, ai obține un set de date extrem de lat!
Datele de credit cr_loan_clean au fost deja încărcate în spațiul de lucru.
Acest exercițiu face parte din cursul
Modelarea Riscului de Credit în Python
Instrucțiuni pentru exercițiu
- Creează un set de date cu toate coloanele numerice, numit
cred_num, și unul cu coloanele non-numerice, numitcred_str. - Aplică codificarea one-hot pe
cred_strpentru a crea un nou set de date numitcred_str_onehot. - Unește
cred_numcu noile date codificate one-hot și stochează rezultatul cacr_loan_prep. - Afișează coloanele noului set de date.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)