Разбивка данных на обучающую и тестовую выборки
Последний шаг перед построением регрессионной модели! В этом упражнении вы определите названия целевой переменной и столбцов признаков, извлечёте данные и разобьёте их на обучающую и тестовую выборки.
Библиотеки pandas и numpy загружены как pd и np соответственно. Входные признаки импортированы как набор данных features, а целевая переменная, которую вы построили в предыдущем упражнении, импортирована как Y.
Это упражнение является частью курса
Машинное обучение для маркетинга на Python
Инструкции к упражнению
- Сохраните название столбца с идентификатором клиента в виде списка.
- Выберите названия столбцов признаков, исключив столбец с идентификатором клиента.
- Извлеките признаки в переменную
X. - Разбейте данные на обучающую и тестовую выборки с помощью функции
train_test_split().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Store customer identifier column name as a list
custid = ['___']
# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]
# Extract the features as `X`
X = features[___]
# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)