CommencezCommencez gratuitement

Piège des variables fictives

Le piège des variables fictives survient lorsque différentes variables indicatrices transmettent la même information. Ici, si une personne employée provient, par exemple, du service de la comptabilité (c.-à-d. la valeur de la colonne accounting est 1), vous êtes certain qu'elle ne vient d'aucun autre service (les autres valeurs sont 0). Vous pourriez donc déduire son service en regardant toutes les autres colonnes de service.

Pour cette raison, lorsque \(n\) variables fictives sont créées (dans votre cas, 10), seulement \(n\) - 1 (dans votre cas, 9) suffisent, et l'information de la \(n\)-ième colonne est déjà incluse.

Par conséquent, vous allez vous débarrasser de l'ancienne colonne du service, supprimer une des variables fictives de service pour éviter le piège des variables fictives, puis joindre les deux DataFrames.

Cette activité fait partie du cours

Analytique RH : prédire le roulement du personnel avec Python

Voir le cours

Instructions de l’exercice

  • Utilisez .drop() sur la colonne accounting pour éviter le « piège des variables fictives ».
  • Supprimez l'ancienne colonne department avec .drop() puisque vous n'en avez plus besoin.
  • Joignez le nouveau DataFrame departments à l'ensemble de données employee (cela a été fait pour vous).

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Drop the "accounting" column to avoid "dummy trap"
departments = departments.____("____", axis=1)

# Drop the old column "department" as you don't need it anymore
data = data.____("____", axis=1)

# Join the new DataFrame "departments" to your employee dataset: done
data = data.join(departments)
Modifier et exécuter le code