Анализ уровня оттока и разбивка данных
Опираясь на обзор из главы 1, в этом уроке вы углубитесь в подготовку данных для прогнозирования оттока с помощью машинного обучения. Вы изучите распределение оттока и разобьёте данные на обучающую и тестовую выборки, прежде чем перейти к построению модели. На этом этапе вы поймёте, как распределён уровень оттока, и предобработаете данные: обучающая выборка понадобится для построения модели, а тестовая — для оценки её качества на новых данных.
Набор данных телекоммуникационной компании загружен как pandas DataFrame с именем telcom. Столбец с целевой переменной называется Churn.
Это упражнение является частью курса
Машинное обучение для маркетинга на Python
Инструкции к упражнению
- Выведите уникальные значения столбца
Churn. - Вычислите долю каждой группы оттока относительно общего размера данных.
- Импортируйте функцию для разбивки данных на обучающую и тестовую выборки.
- Разделите данные в соотношении 75% для обучения и 25% для тестирования.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Print the unique Churn values
print(___(telcom['Churn']))
# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100
# Import the function for splitting data to train and test
from sklearn.model_selection import ___
# Split the data into train and test
train, test = ___(telcom, test_size = .25)