Codificarea datelor
Codificarea datelor categoriale le face utilizabile pentru algoritmii de învățare automată. R codifică factorii intern, însă codificarea este necesară atunci când îți dezvolți propriile modele.
În acest exercițiu, vei construi mai întâi un model liniar folosind lm(), apoi vei dezvolta propriul model pas cu pas.
În one hot encoding, se creează o coloană separată pentru fiecare nivel.

Observă că una dintre coloane poate fi dedusă din celelalte (de exemplu, valorile 0 din coloanele „B" și „C" implică valoarea 1 în coloana „A"). Așadar, poți elimina prima coloană pentru regresia liniară. Vom analiza modelele liniare în detaliu în capitolul următor.
Pentru one hot encoding, poți folosi dummyVars() din pachetul caret.
Pentru a-l utiliza, creează mai întâi codificatorul, apoi transformă setul de date:
encoder <- dummyVars(~ category, data = df)
predict(encoder, newdata = df)
Cazurile complete din setul de date al sondajului din pachetul MASS sunt disponibile ca survey.
Pachetul caret a fost preîncărcat.
Acest exercițiu face parte din cursul
Exersarea întrebărilor de interviu la statistică în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Fit a linear model
lm(___ ~ Exer, data = ___)