Kategoriska kodningar
Din kollega har konverterat kolumnerna i kreditdatamängden till numeriska värden med hjälp av LabelEncoder(). Han utelämnade en: credit_history, som registrerar sökandens kredithistorik. Du vill skapa två versioner av datamängden – en med LabelEncoder() och en med one-hot-kodning – för jämförelseändamål. Särdragsmatrisen finns tillgänglig som credit. Du har LabelEncoder() förladdat och pandas som pd.
Den här övningen är en del av kursen
Att designa maskininlärningsflöden i Python
Övningsinstruktioner
- Koda
credit_historymed hjälp avLabelEncoder(). - Konkatenera resultatet till den ursprungliga dataramen.
- Skapa en ny dataram genom att konkatenera one-hot-kodningens dummyvariabler till den ursprungliga dataramen.
- Bekräfta att one-hot-kodning ger fler kolumner än labelkodning.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create numeric encoding for credit_history
credit_history_num = ____.____(
credit[____])
# Create a new feature matrix including the numeric encoding
X_num = pd.concat([X, pd.Series(____)], ____)
# Create new feature matrix with dummies for credit_history
X_hot = pd.concat(
[X, ____.____(credit[____])], ____)
# Compare the number of features of the resulting DataFrames
print(X_hot.shape[____] > X_num.shape[____])