One-hot kódování úvěrových dat
Je čas připravit nečíselné sloupce tak, aby je bylo možné přidat do modelu LogisticRegression().
Jakmile pomocí one-hot kódování vytvoříš nové sloupce, můžeš je zřetězit s číselnými sloupci a sestavit nový datový rámec, který budeš po zbytek kurzu používat k předpovídání pravděpodobnosti defaultu.
Nezapomeň provést one-hot kódování pouze na nečíselných sloupcích. Kdybys ho aplikoval/a i na číselné sloupce, vznikl by neskutečně široký datový rámec!
Úvěrová data cr_loan_clean jsou v pracovním prostředí již načtena.
Toto cvičení je součástí kurzu
Credit Risk Modeling in Python
Pokyny k cvičení
- Vytvoř datovou sadu se všemi číselnými sloupci s názvem
cred_numa datovou sadu s nečíselnými sloupci s názvemcred_str. - Aplikuj one-hot kódování na
cred_stra výsledek ulož do nové datové sadycred_str_onehot. - Spoj
cred_nums nově one-hot zakódovanými daty a výsledek ulož jakocr_loan_prep. - Vypiš sloupce nového datového rámce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)