One-hot-kodning av specifika kolumner
En lokal återförsäljare av begagnade bilar vill ha hjälp med att förutsäga försäljningspriset på sina fordon. Om du använder one-hot-kodning på hela datamängden used_cars får den nya datamängden över 1 200 kolumner. Du är orolig att det kan orsaka problem när du tränar dina maskininlärningsmodeller för att förutsäga priset. Du har därför bestämt dig för att prova en enklare metod och bara använda one-hot-kodning på ett fåtal kolumner.
Den här övningen är en del av kursen
Arbeta med kategoriska data i Python
Övningsinstruktioner
- Skapa en ny datamängd,
used_cars_simple, med one-hot-kodning för följande kolumner:"manufacturer_name"och"transmission"(i den ordningen). - Sätt prefixet för alla nya kolumner till
"dummy", så att du enkelt kan filtrera fram de nyligen skapade kolumnerna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create one-hot encoding for just two columns
used_cars_simple = pd.____(
used_cars,
# Specify the columns from the instructions
____,
# Set the prefix
____
)
# Print the shape of the new dataset
print(used_cars_simple.shape)