НачатьНачать бесплатно

Кодирование категориальных и масштабирование числовых переменных

На этом завершающем шаге вы выполните унитарное кодирование (one-hot encoding) категориальных переменных, а затем масштабируете числовые столбцы. Библиотека pandas уже загружена как pd, а также модуль StandardScaler из sklearn.preprocessing.

Исходный набор данных о телекоммуникационном оттоке telco_raw загружен как DataFrame библиотеки pandas, а также списки custid, target, categorical и numerical с названиями столбцов, которые вы создали в предыдущем упражнении. Вы можете изучить набор данных, исследовав его в консоли.

Это упражнение является частью курса

Машинное обучение для маркетинга на Python

Посмотреть курс

Инструкции к упражнению

  • Выполните унитарное кодирование (one-hot encoding) категориальных переменных.
  • Инициализируйте экземпляр StandardScaler.
  • Обучите scaler на числовых столбцах и преобразуйте их.
  • Постройте DataFrame из scaled_numerical.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Perform one-hot encoding to categorical variables 
telco_raw = pd.get_dummies(data = ___, columns = categorical, drop_first=True)

# Initialize StandardScaler instance
scaler = ___()

# Fit and transform the scaler on numerical columns
scaled_numerical = ___.fit_transform(telco_raw[___])

# Build a DataFrame from scaled_numerical
scaled_numerical = pd.DataFrame(___, columns=numerical)
Редактировать и запускать код