Začněte nyníZačněte zdarma

Dummy trap

Dummy trap nastává v situaci, kdy různé dummy proměnné nesou stejnou informaci. Pokud je například zaměstnanec z účetního oddělení (hodnota ve sloupci accounting je 1), víš s jistotou, že není z žádného jiného oddělení (všude jinde jsou hodnoty 0). O jeho oddělení by ses tedy dozvěděl/a i tak, že se podíváš na všechna ostatní oddělení.

Proto platí, že když vznikne \(n\) dummy proměnných (v tomto případě 10), stačí \(n\) - 1 z nich (v tomto případě 9) – informace z \(n\)-tého sloupce je totiž již obsažena v ostatních.

Proto se zbavíš původního sloupce s oddělením, odstraníš jednu z dummy proměnných, abys předešel/a dummy trapu, a pak obě DataFrames spojíš.

Toto cvičení je součástí kurzu

HR Analytics: Predicting Employee Churn in Python

Zobrazit kurz

Pokyny k cvičení

  • Pomocí .drop() odstraň sloupec accounting, abys předešel/a "dummy trap".
  • Pomocí .drop() odstraň původní sloupec department, který už nepotřebuješ.
  • Spoj nový DataFrame departments s datasetem employee (tato část je již hotová za tebe).

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Drop the "accounting" column to avoid "dummy trap"
departments = departments.____("____", axis=1)

# Drop the old column "department" as you don't need it anymore
data = data.____("____", axis=1)

# Join the new DataFrame "departments" to your employee dataset: done
data = data.join(departments)
Upravit a spustit kód