Datakodning
Kodning av kategoriska data gör dem användbara för maskininlärningsalgoritmer. R kodar faktorer internt, men kodning är nödvändig när du utvecklar dina egna modeller.
I den här övningen bygger du först en linjär modell med lm() och sedan utvecklar du din egen modell steg för steg.
Vid one hot-kodning skapas en separat kolumn för varje nivå.

Observera att en av kolumnerna kan härledas från de övriga – till exempel innebär 0:or i kolumnerna "B" och "C" att värdet i kolumnen "A" är 1. Du kan därför ta bort den första kolumnen vid linjär regression. Vi går igenom linjära modeller mer detaljerat i nästa kapitel.
För one hot-kodning kan du använda dummyVars() från paketet caret.
Använd det genom att först skapa en kodare och sedan transformera datamängden:
encoder <- dummyVars(~ category, data = df)
predict(encoder, newdata = df)
De kompletta fallen från enkätdatamängden i MASS-paketet finns tillgängliga som survey.
Paketet caret är redan inläst.
Den här övningen är en del av kursen
Öva på statistiska intervjufrågor i R
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Fit a linear model
lm(___ ~ Exer, data = ___)