One-hot encoding pro vybrané sloupce
Místní autobazar potřebuje pomoct s předpovídáním prodejní ceny vozidel. Pokud použiješ one-hot encoding na celý dataset used_cars, vznikne nový dataset s více než 1 200 sloupci. Obáváš se, že by to mohlo způsobit problémy při trénování modelů strojového učení pro předpověď ceny. Rozhodl ses proto pro jednodušší přístup a one-hot encoding použiješ jen na několik sloupců.
Toto cvičení je součástí kurzu
Working with Categorical Data in Python
Pokyny k cvičení
- Vytvoř nový dataset
used_cars_simples one-hot encodingem pro tyto sloupce:"manufacturer_name"a"transmission"(v tomto pořadí). - Nastav prefix všech nových sloupců na
"dummy", abys je mohl/a snadno odfiltrovat.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create one-hot encoding for just two columns
used_cars_simple = pd.____(
used_cars,
# Specify the columns from the instructions
____,
# Set the prefix
____
)
# Print the shape of the new dataset
print(used_cars_simple.shape)