Dummyfällan
En dummyfälla uppstår när olika dummyvariabler innehåller samma information. Om en anställd till exempel tillhör ekonomiavdelningen (dvs. värdet i kolumnen accounting är 1), vet du med säkerhet att personen inte tillhör någon annan avdelning (alla övriga värden är 0).
Du kan alltså ta reda på vilken avdelning personen tillhör genom att titta på alla de andra avdelningarna.
Av den anledningen räcker det, när \(n\) dummyvariabler skapas (i ditt fall 10), med \(n\) - 1 (i ditt fall 9) av dem – informationen i den \(n\):te kolumnen är redan inkluderad.
Du ska därför ta bort den gamla avdelningskolumnen, ta bort en av avdelningsdummyerna för att undvika dummyfällan och sedan slå samman de två DataFrames.
Den här övningen är en del av kursen
HR-analys: Förutsäg personalomsättning i Python
Övningsinstruktioner
- Använd
.drop()för att ta bort kolumnenaccountingoch undvika dummyfällan. - Använd
.drop()för att ta bort den gamla kolumnendepartmenteftersom du inte längre behöver den. - Slå samman den nya DataFramen
departmentsmed datamängdenemployee(detta har redan gjorts åt dig).
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Drop the "accounting" column to avoid "dummy trap"
departments = departments.____("____", axis=1)
# Drop the old column "department" as you don't need it anymore
data = data.____("____", axis=1)
# Join the new DataFrame "departments" to your employee dataset: done
data = data.join(departments)