Piège des variables fictives
Le piège des variables fictives survient lorsque différentes variables indicatrices transmettent la même information. Ici, si une personne employée provient, par exemple, du service de la comptabilité (c.-à-d. la valeur de la colonne accounting est 1), vous êtes certain qu'elle ne vient d'aucun autre service (les autres valeurs sont 0).
Vous pourriez donc déduire son service en regardant toutes les autres colonnes de service.
Pour cette raison, lorsque \(n\) variables fictives sont créées (dans votre cas, 10), seulement \(n\) - 1 (dans votre cas, 9) suffisent, et l'information de la \(n\)-ième colonne est déjà incluse.
Par conséquent, vous allez vous débarrasser de l'ancienne colonne du service, supprimer une des variables fictives de service pour éviter le piège des variables fictives, puis joindre les deux DataFrames.
Cette activité fait partie du cours
Analytique RH : prédire le roulement du personnel avec Python
Instructions de l’exercice
- Utilisez
.drop()sur la colonneaccountingpour éviter le « piège des variables fictives ». - Supprimez l'ancienne colonne
departmentavec.drop()puisque vous n'en avez plus besoin. - Joignez le nouveau DataFrame
departmentsà l'ensemble de donnéesemployee(cela a été fait pour vous).
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Drop the "accounting" column to avoid "dummy trap"
departments = departments.____("____", axis=1)
# Drop the old column "department" as you don't need it anymore
data = data.____("____", axis=1)
# Join the new DataFrame "departments" to your employee dataset: done
data = data.join(departments)