ПочатиПочніть безкоштовно

Пастка з фіктивними змінними

Пастка з фіктивними змінними — це ситуація, коли різні фіктивні змінні передають ту саму інформацію. У нашому випадку, якщо працівник, скажімо, з бухгалтерії (тобто значення в стовпці accounting дорівнює 1), то ви напевно знаєте, що він/вона не з жодного іншого відділу (всюди далі значення 0). Отже, про відділ можна дізнатися, подивившись на всі інші фіктивні змінні відділів.

Тому, коли створюється \(n\) фіктивних змінних (у цьому завданні — 10), достатньо лише \(n\) - 1 (тут — 9), а інформація \(n\)-го стовпця вже врахована.

Відповідно, ви приберете старий стовпець з відділом, видалите одну з фіктивних змінних відділів, щоб уникнути пастки, і потім об'єднаєте два датафрейми.

Ця вправа є частиною курсу

HR Analytics: прогнозування плинності персоналу в Python

Переглянути курс

Інструкції до вправи

  • Виконайте .drop() для стовпця accounting, щоб уникнути "пастки з фіктивними змінними".
  • Виконайте .drop() для старого стовпця department, оскільки він більше не потрібен.
  • Об'єднайте новий датафрейм departments з набором даних employee (це вже зроблено за вас).

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Drop the "accounting" column to avoid "dummy trap"
departments = departments.____("____", axis=1)

# Drop the old column "department" as you don't need it anymore
data = data.____("____", axis=1)

# Join the new DataFrame "departments" to your employee dataset: done
data = data.join(departments)
Редагувати та запускати код