Пастка з фіктивними змінними
Пастка з фіктивними змінними — це ситуація, коли різні фіктивні змінні передають ту саму інформацію. У нашому випадку, якщо працівник, скажімо, з бухгалтерії (тобто значення в стовпці accounting дорівнює 1), то ви напевно знаєте, що він/вона не з жодного іншого відділу (всюди далі значення 0).
Отже, про відділ можна дізнатися, подивившись на всі інші фіктивні змінні відділів.
Тому, коли створюється \(n\) фіктивних змінних (у цьому завданні — 10), достатньо лише \(n\) - 1 (тут — 9), а інформація \(n\)-го стовпця вже врахована.
Відповідно, ви приберете старий стовпець з відділом, видалите одну з фіктивних змінних відділів, щоб уникнути пастки, і потім об'єднаєте два датафрейми.
Ця вправа є частиною курсу
HR Analytics: прогнозування плинності персоналу в Python
Інструкції до вправи
- Виконайте
.drop()для стовпцяaccounting, щоб уникнути "пастки з фіктивними змінними". - Виконайте
.drop()для старого стовпцяdepartment, оскільки він більше не потрібен. - Об'єднайте новий датафрейм
departmentsз набором данихemployee(це вже зроблено за вас).
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Drop the "accounting" column to avoid "dummy trap"
departments = departments.____("____", axis=1)
# Drop the old column "department" as you don't need it anymore
data = data.____("____", axis=1)
# Join the new DataFrame "departments" to your employee dataset: done
data = data.join(departments)