Začněte nyníZačněte zdarma

One-hot encoding pro vybrané sloupce

Místní autobazar potřebuje pomoct s předpovídáním prodejní ceny vozidel. Pokud použiješ one-hot encoding na celý dataset used_cars, vznikne nový dataset s více než 1 200 sloupci. Obáváš se, že by to mohlo způsobit problémy při trénování modelů strojového učení pro předpověď ceny. Rozhodl ses proto pro jednodušší přístup a one-hot encoding použiješ jen na několik sloupců.

Toto cvičení je součástí kurzu

Working with Categorical Data in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř nový dataset used_cars_simple s one-hot encodingem pro tyto sloupce: "manufacturer_name" a "transmission" (v tomto pořadí).
  • Nastav prefix všech nových sloupců na "dummy", abys je mohl/a snadno odfiltrovat.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create one-hot encoding for just two columns
used_cars_simple = pd.____(
  used_cars,
  # Specify the columns from the instructions
  ____,
  # Set the prefix
  ____
)

# Print the shape of the new dataset
print(used_cars_simple.shape)
Upravit a spustit kód