One-hot-kodning av kreditdata
Nu är det dags att förbereda de icke-numeriska kolumnerna så att de kan läggas till i din LogisticRegression()-modell.
När de nya kolumnerna har skapats med one-hot-kodning kan du sammanfoga dem med de numeriska kolumnerna för att skapa en ny dataram, som sedan används genom resten av kursen för att förutsäga sannolikheten för fallissemang.
Kom ihåg att bara one-hot-koda de icke-numeriska kolumnerna. Om du gör det med de numeriska kolumnerna också får du en orimligt bred datamängd!
Kreditlånedatan, cr_loan_clean, har redan lästs in i workspace.
Den här övningen är en del av kursen
Kreditriskmodellering i Python
Övningsinstruktioner
- Skapa en datamängd för alla numeriska kolumner med namnet
cred_numoch en för de icke-numeriska kolumnerna med namnetcred_str. - Använd one-hot-kodning på
cred_strför att skapa en ny datamängd kalladcred_str_onehot. - Slå ihop
cred_nummed de nya one-hot-kodade data och spara resultatet somcr_loan_prep. - Skriv ut kolumnerna i den nya datamängden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)