Dummy trap
Dummy trap nastává v situaci, kdy různé dummy proměnné nesou stejnou informaci. Pokud je například zaměstnanec z účetního oddělení (hodnota ve sloupci accounting je 1), víš s jistotou, že není z žádného jiného oddělení (všude jinde jsou hodnoty 0).
O jeho oddělení by ses tedy dozvěděl/a i tak, že se podíváš na všechna ostatní oddělení.
Proto platí, že když vznikne \(n\) dummy proměnných (v tomto případě 10), stačí \(n\) - 1 z nich (v tomto případě 9) – informace z \(n\)-tého sloupce je totiž již obsažena v ostatních.
Proto se zbavíš původního sloupce s oddělením, odstraníš jednu z dummy proměnných, abys předešel/a dummy trapu, a pak obě DataFrames spojíš.
Toto cvičení je součástí kurzu
HR Analytics: Predicting Employee Churn in Python
Pokyny k cvičení
- Pomocí
.drop()odstraň sloupecaccounting, abys předešel/a "dummy trap". - Pomocí
.drop()odstraň původní sloupecdepartment, který už nepotřebuješ. - Spoj nový DataFrame
departmentss datasetememployee(tato část je již hotová za tebe).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Drop the "accounting" column to avoid "dummy trap"
departments = departments.____("____", axis=1)
# Drop the old column "department" as you don't need it anymore
data = data.____("____", axis=1)
# Join the new DataFrame "departments" to your employee dataset: done
data = data.join(departments)