Дослідження частки відтоку та розбиття даних
Спираючись на огляд із Розділу 1, у цьому уроці ви детальніше опрацюєте підготовку даних, потрібну для використання методів машинного навчання для прогнозування відтоку. Ви дослідите розподіл відтоку та розділите дані на тренувальні й тестові перед тим, як перейти до моделювання. На цьому кроці ви зрозумієте, як розподіляється рівень відтоку, і виконаєте попередню обробку даних, щоб побудувати модель на тренувальній вибірці та оцінити її ефективність на невикористаних тестових даних.
Набір даних телеком-компанії завантажено як датафрейм pandas під назвою telcom. Стовпець цільової змінної має назву Churn.
Ця вправа є частиною курсу
Machine Learning для маркетингу в Python
Інструкції до вправи
- Виведіть унікальні значення у стовпці
Churn. - Обчисліть частку (частотну частку) для кожної групи відтоку.
- Імпортуйте функцію для розбиття даних на train і test.
- Розбийте дані на 75% train і 25% test.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Print the unique Churn values
print(___(telcom['Churn']))
# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100
# Import the function for splitting data to train and test
from sklearn.model_selection import ___
# Split the data into train and test
train, test = ___(telcom, test_size = .25)