Кодирование категориальных и масштабирование числовых переменных
На этом завершающем шаге вы выполните унитарное кодирование (one-hot encoding) категориальных переменных, а затем масштабируете числовые столбцы. Библиотека pandas уже загружена как pd, а также модуль StandardScaler из sklearn.preprocessing.
Исходный набор данных о телекоммуникационном оттоке telco_raw загружен как DataFrame библиотеки pandas, а также списки custid, target, categorical и numerical с названиями столбцов, которые вы создали в предыдущем упражнении. Вы можете изучить набор данных, исследовав его в консоли.
Это упражнение является частью курса
Машинное обучение для маркетинга на Python
Инструкции к упражнению
- Выполните унитарное кодирование (one-hot encoding) категориальных переменных.
- Инициализируйте экземпляр
StandardScaler. - Обучите
scalerна числовых столбцах и преобразуйте их. - Постройте DataFrame из
scaled_numerical.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Perform one-hot encoding to categorical variables
telco_raw = pd.get_dummies(data = ___, columns = categorical, drop_first=True)
# Initialize StandardScaler instance
scaler = ___()
# Fit and transform the scaler on numerical columns
scaled_numerical = ___.fit_transform(telco_raw[___])
# Build a DataFrame from scaled_numerical
scaled_numerical = pd.DataFrame(___, columns=numerical)