Kom igångKom igång gratis

One-hot-kodning av kreditdata

Nu är det dags att förbereda de icke-numeriska kolumnerna så att de kan läggas till i din LogisticRegression()-modell.

När de nya kolumnerna har skapats med one-hot-kodning kan du sammanfoga dem med de numeriska kolumnerna för att skapa en ny dataram, som sedan används genom resten av kursen för att förutsäga sannolikheten för fallissemang.

Kom ihåg att bara one-hot-koda de icke-numeriska kolumnerna. Om du gör det med de numeriska kolumnerna också får du en orimligt bred datamängd!

Kreditlånedatan, cr_loan_clean, har redan lästs in i workspace.

Den här övningen är en del av kursen

Kreditriskmodellering i Python

Visa kurs

Övningsinstruktioner

  • Skapa en datamängd för alla numeriska kolumner med namnet cred_num och en för de icke-numeriska kolumnerna med namnet cred_str.
  • Använd one-hot-kodning på cred_str för att skapa en ny datamängd kallad cred_str_onehot.
  • Slå ihop cred_num med de nya one-hot-kodade data och spara resultatet som cr_loan_prep.
  • Skriv ut kolumnerna i den nya datamängden.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])

# One-hot encode the non-numeric columns
____ = pd.____(____)

# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)

# Print the columns in the new data set
print(____.columns)
Redigera och kör kod