Kom igångKom igång gratis

Dummyfällan

En dummyfälla uppstår när olika dummyvariabler innehåller samma information. Om en anställd till exempel tillhör ekonomiavdelningen (dvs. värdet i kolumnen accounting är 1), vet du med säkerhet att personen inte tillhör någon annan avdelning (alla övriga värden är 0). Du kan alltså ta reda på vilken avdelning personen tillhör genom att titta på alla de andra avdelningarna.

Av den anledningen räcker det, när \(n\) dummyvariabler skapas (i ditt fall 10), med \(n\) - 1 (i ditt fall 9) av dem – informationen i den \(n\):te kolumnen är redan inkluderad.

Du ska därför ta bort den gamla avdelningskolumnen, ta bort en av avdelningsdummyerna för att undvika dummyfällan och sedan slå samman de två DataFrames.

Den här övningen är en del av kursen

HR-analys: Förutsäg personalomsättning i Python

Visa kurs

Övningsinstruktioner

  • Använd .drop() för att ta bort kolumnen accounting och undvika dummyfällan.
  • Använd .drop() för att ta bort den gamla kolumnen department eftersom du inte längre behöver den.
  • Slå samman den nya DataFramen departments med datamängden employee (detta har redan gjorts åt dig).

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Drop the "accounting" column to avoid "dummy trap"
departments = departments.____("____", axis=1)

# Drop the old column "department" as you don't need it anymore
data = data.____("____", axis=1)

# Join the new DataFrame "departments" to your employee dataset: done
data = data.join(departments)
Redigera och kör kod