ÎncepețiÎncepe gratuit

Capcana variabilelor dummy

Capcana variabilelor dummy apare atunci când mai multe variabile dummy transmit aceeași informație. În acest caz, dacă un angajat provine, să zicem, din departamentul de contabilitate (adică valoarea din coloana accounting este 1), atunci ești sigur că el/ea nu face parte din niciunul dintre celelalte departamente (valorile de pretutindeni sunt 0). Prin urmare, poți afla departamentul său uitându-te la toate celelalte departamente.

Din acest motiv, ori de câte ori se creează \(n\) variabile dummy (în cazul tău, 10), doar \(n\) - 1 (în cazul tău, 9) sunt suficiente, deoarece informația din cea de-a \(n\)-a coloană este deja inclusă.

Așadar, vei elimina vechea coloană a departamentului, vei renunța la una dintre variabilele dummy ale departamentului pentru a evita capcana dummy, iar apoi vei uni cele două DataFrame-uri.

Acest exercițiu face parte din cursul

HR Analytics: Predicția fluctuației angajaților în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește .drop() pentru a elimina coloana accounting și a evita "capcana dummy".
  • Folosește .drop() pentru a elimina vechea coloană department, deoarece nu mai ai nevoie de ea.
  • Unește noul DataFrame departments cu setul de date employee (acest pas a fost deja realizat pentru tine).

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Drop the "accounting" column to avoid "dummy trap"
departments = departments.____("____", axis=1)

# Drop the old column "department" as you don't need it anymore
data = data.____("____", axis=1)

# Join the new DataFrame "departments" to your employee dataset: done
data = data.join(departments)
Editează și rulează codul