Začněte nyníZačněte zdarma

One-hot kódování úvěrových dat

Je čas připravit nečíselné sloupce tak, aby je bylo možné přidat do modelu LogisticRegression().

Jakmile pomocí one-hot kódování vytvoříš nové sloupce, můžeš je zřetězit s číselnými sloupci a sestavit nový datový rámec, který budeš po zbytek kurzu používat k předpovídání pravděpodobnosti defaultu.

Nezapomeň provést one-hot kódování pouze na nečíselných sloupcích. Kdybys ho aplikoval/a i na číselné sloupce, vznikl by neskutečně široký datový rámec!

Úvěrová data cr_loan_clean jsou v pracovním prostředí již načtena.

Toto cvičení je součástí kurzu

Credit Risk Modeling in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř datovou sadu se všemi číselnými sloupci s názvem cred_num a datovou sadu s nečíselnými sloupci s názvem cred_str.
  • Aplikuj one-hot kódování na cred_str a výsledek ulož do nové datové sady cred_str_onehot.
  • Spoj cred_num s nově one-hot zakódovanými daty a výsledek ulož jako cr_loan_prep.
  • Vypiš sloupce nového datového rámce.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])

# One-hot encode the non-numeric columns
____ = pd.____(____)

# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)

# Print the columns in the new data set
print(____.columns)
Upravit a spustit kód