НачатьНачать бесплатно

Анализ уровня оттока и разбивка данных

Опираясь на обзор из главы 1, в этом уроке вы углубитесь в подготовку данных для прогнозирования оттока с помощью машинного обучения. Вы изучите распределение оттока и разобьёте данные на обучающую и тестовую выборки, прежде чем перейти к построению модели. На этом этапе вы поймёте, как распределён уровень оттока, и предобработаете данные: обучающая выборка понадобится для построения модели, а тестовая — для оценки её качества на новых данных.

Набор данных телекоммуникационной компании загружен как pandas DataFrame с именем telcom. Столбец с целевой переменной называется Churn.

Это упражнение является частью курса

Машинное обучение для маркетинга на Python

Посмотреть курс

Инструкции к упражнению

  • Выведите уникальные значения столбца Churn.
  • Вычислите долю каждой группы оттока относительно общего размера данных.
  • Импортируйте функцию для разбивки данных на обучающую и тестовую выборки.
  • Разделите данные в соотношении 75% для обучения и 25% для тестирования.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Print the unique Churn values
print(___(telcom['Churn']))

# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100

# Import the function for splitting data to train and test
from sklearn.model_selection import ___

# Split the data into train and test
train, test = ___(telcom, test_size = .25)
Редактировать и запускать код